19498 字
97 分钟

从0学会调教虚拟歌姬!

从0学会调教虚拟歌姬!#

文档版本:v1.0

编者宇航按

这是宝安中学VOCALOID社的调教(调校)教程。由初代社长宇航一人编写,恐有错漏,望请谅解。

编曲做出了伴奏,填词写好了歌词,虚拟歌手唱出来了——但“唱出来了”不等于“唱得好听”。默认情况下,虚拟歌手的声音是平的:音准是对的,节奏是对的,但听起来像机器在念。调教要做的就是让那个声音从“平的”变成“有起伏的”,从“能听”变成“好听”。

本教程围绕“让虚拟歌手唱得好听”这一核心任务展开,从发音、音高线(PIT)、颤音开始,逐步深入到各类参数(DYN、BRI、GEN、BRE、Tension)的组合使用,然后分平台介绍VOCALOID、Synthesizer V、OpenUTAU的具体操作,最后覆盖戏腔、快节奏段落、抒情段落等特定场景的调教技巧。调教的核心逻辑在三个平台上是相通的——控制音高曲线、音量动态、音色参数来改变虚拟歌手的演唱表现。掌握了这些,你可以在不同平台之间切换而不需要重新学习。

和之前的教程一样,如果你遇到不熟悉的术语,可以在B站搜索章节名找视频教程,也可以使用AI工具协助理解。

祝你调教顺利。

宇航

2026年8月

总目录

第一篇:声音的基础(共通篇)

第一章 发音与元音

第二章 音高线(PIT)——虚拟歌手的“音准”

第三章 颤音

第二篇:参数篇(共通篇)

第四章 DYN——音量动态

第五章 BRI/GEN/BRE——音色三参数

第六章 张力与气声(SV/OpenUTAU进阶)

第七章 参数的组合逻辑

第三篇:操作篇(分平台)

第八章 VOCALOID调教

第九章 Synthesizer V调教

第十章 OpenUTAU调教

第四篇:进阶篇

第十一章 戏腔调教(共通)

第十二章 快节奏段落调教(共通)

第十三章 抒情段落调教(共通)

第五篇:实战篇

第十四章 调教流程

第十五章 常见问题与解决方案

附录

附录A:三大软件参数对照表

附录B:常用中文声调PIT绘制参考

附录C:调教快捷键速查

附录D:常用术语中英对照表

附录E:软件下载与资源获取

调教教程——第一篇:声音的基础(共通篇)

序言:调教是什么

调教,英文叫Tuning,是调整虚拟歌手的演唱参数,使其发音更准确、声音更自然、情绪表达更到位的过程。

编曲做出了伴奏,填词写好了歌词,但虚拟歌手唱出来时,它默认的声音是“平的”。音准是准的,节奏是对的,但听起来像机器在念。调教就是把那种“平的”变成“有起伏的”。我们不是要修音准,虚拟歌手的音准本来就不需要修。我们要修的是它缺失的那种人味。

调教的核心任务分三个层次。发音层,字唱对了、不吞字,这是最基础的。自然层,声音流畅、有呼吸感,听起来像人在唱而不是机器在念。情绪层,该爆发时爆发、该收时收,让声音真正传达情感。三个层次依次递进,初学者应从发音层开始,逐步深入。

VOCALOID、Synthesizer V、OpenUTAU虽然操作界面不同,但调教的核心逻辑相同。三个软件都是通过控制音高曲线、音量动态、音色参数来改变虚拟歌手的演唱表现。本教程以共性为框架,分平台时再说明具体差异。掌握一个软件之后,切换到另一个软件只需要重新熟悉界面,调教的思路是通用的。

在动手画参数之前,需要先理解虚拟歌手是如何发声的。本章从发音的基本单位,元音和声母,开始。

第一章:发音与元音

元音是虚拟歌手声音的核心。元音决定声音的“开”与“闭”。开音,比如a、o、e,在长音上自然饱满;闭音,比如i、u、ü,在短音上清晰。我们在填词时已经考虑了这一点,但调教阶段仍可微调。

元音长度影响听感。在调教中,元音的时值决定了声音的舒展度。一个开音如果被缩得太短会显得仓促,好像话没说完就被切断了。一个闭音如果被拖得太长会显得不自然,像在硬撑。如果你听到某个字唱出来总觉得不对劲,先检查它的元音长度和旋律时值是否匹配。

声母是声音的起头,决定了咬字的清晰度。声母包括b、p、m、f、d、t、n、l、g、k、h、j、q、x、zh、ch、sh、r、z、c、s、y、w。在调教中,声母的时值可以通过调整音符的起始位置来控制。在VOCALOID和SV中,可以通过音符属性中的辅音时长参数来缩短或延长声母。在OpenUTAU中,可以通过调整音素边界来控制。对于爆破音,比如b、p、d、t、g、k,声母时值极短,调整范围有限,强行拉长反而会破坏发音的清晰度。

拆音的中级操作也在这里涉及。拆音是在长音上将同一个字拆成两个或多个音符。调教阶段要在不同音符之间画连续滑音,防止听起来像两个字。比如“光”拆成两个音,如果两个音之间没有滑音,就会变成“姑昂”。滑音让它们连在一起,听起来还是一个“光”字,只是音高有了变化。

鼻音和边音的发力区别需要注意。鼻音包括n、ng,需要保持鼻腔共鸣,能量较强。边音l是气流从舌头两侧通过,较柔和。在快速段落中,边音比鼻音更容易被清晰地唱出来,因为它的发音阻力更小。但在低音区或能量较低的段落中,边音可能会被吞掉。如果发现某个l开头的字在低音区听不清,可以适当提高那个音节的音量,或者把声母时值稍微拉长一点。

爆破音在快速段落中最容易出问题。b、p、d、t、g、k这些音在快速段落中极易被吞掉或模糊。调教方法有两种。一是在音符前面增加极短的空白,大约10到20毫秒,让声母有释放空间。二是在音符的辅音部分增大音量。在VOCALOID中通过辅音时长参数控制,在SV中通过音符偏移调整,在OpenUTAU中通过手动调整音素边界完成。如果你听到快节奏段落里某个字的开头像被吃掉了一样,就用这两种方法试试。

掌握了发音的基础之后,现在进入调教最核心的操作:音高线。

第二章:音高线(PIT)——虚拟歌手的音准

PIT参数控制虚拟歌手偏离基准音高多少音分。一个半音等于100音分。虚拟歌手的默认PIT是一条水平线,表示精准地唱在基准音高上。但真实人声永远不会精确停留在一条直线上。它有微小的波动、有滑音、有音头的偏离。PIT的默认状态是平的,这是听起来机械的核心原因。

PIT有两种形态,按功能分为连接型和修饰型。

连接型PIT用于字与字之间。在两个相邻音符之间画一条平滑的曲线,让前一个音的尾部滑向下一个音的头。核心规律是:如果前一个音是去声,比如“去”,曲线应从高到低;如果前一个音是阳平,比如“来”,曲线应从低到高。连接型PIT不需要剧烈变化,少量偏移已足够产生明显效果。有时候只需要偏移20到30音分,听感就完全不同了。

修饰型PIT用于字内装饰。在一个音符内部画弯曲线条,制造哭腔、甩腔、叹气等效果。常见形态包括先降后升,先低于目标音再滑回;先升后降,先高于目标音再滑回;波浪形,连续小起伏。

PIT的三种基本操作有各自的适用场景。

先降后升适合去声字,比如“去”“是”“落”。音头先微降,再快速上滑到目标音。这个形态模拟了去声字声调的下行特征,然后通过上滑回到基准音高。它也可以用于强调某个字,让那个字听起来更重。

先升后降适合阳平字,比如“人”“明”。音头先微升再回落,模拟阳平的上行特征。这个形态也可以用于制造叹气效果,让音符的尾部轻轻落下。

波浪形适合长音,制造自然波动感,避免长音听起来死。在长音的中段画两到三个小波浪,幅度控制在10到20音分,频率不要太高,听起来就像真人在维持长音时的小幅抖动。

PIT绘制有几个常见误区。曲线不能画得太陡,否则听起来会像音准失控,好像歌手突然跑调了。不能画得太平,否则效果不明显,等于没画。不能频繁改变方向,否则听起来会像在颤抖,像得了帕金森。练习方法是在DAW中取一个简单的音符,尝试三种基本操作,导出听效果。先用一个音试,再放到一个词里试,最后放到一句里试。

PIT画好了,声音听起来已经有起伏了。但还有一个容易被忽略的细节,颤音。

第三章:颤音

自然颤音是声音在目标音高附近的小幅周期性摆动,通常频率在5到7Hz之间,幅度在5到20音分之间。它是真人演唱时声带自然震动的结果。虚拟歌手默认没有颤音,或者只有固定的软件算法生成颤音,这是听起来机械的另一个原因。一个没有颤音的长音,就像一个没有表情的注视,虽然准确,但没有温度。

颤音的实现有两种方式。

第一种是软件生成颤音。在VOCALOID、SV、OpenUTAU中,可以通过颤音参数自动生成周期性摆动。优点是快速、准确,缺点是缺少变化,开始和结束的幅度相同,听起来有点僵硬。在VOCALOID中通过音符属性中的颤音参数调整,在SV中通过颤音曲线编辑器调整,在OpenUTAU中通过表达式系统实现。颤音参数通常包括颤音幅度、颤音频率、颤音延迟和颤音持续时间。颤音幅度是摆动的剧烈程度,颤音频率是摆动的速度,颤音延迟是开始颤音的时间,颤音持续时间是颤音的长度占音符时值的比例。调整颤音延迟参数可以让颤音在长音的后半段才开始出现,更接近自然演唱的规律,避免机械感。一个三拍的长音,前两拍保持平稳,最后一拍才开始颤,这是真人歌手最自然的处理方式。

第二种是手绘PIT颤音。通过手动绘制PIT曲线来模拟颤音。优势是可控、自然,劣势是耗时。通常手绘颤音用于特定修饰,比如句尾的强调颤音,软件生成颤音用于长音维持。两者应该配合使用。不要只用一种方式,那样要么太呆板,要么太累。

颤音有三种类型。开始型,音头即带颤音,适合快节奏、强情绪段落,一开口就抖起来,很有力量。过程型,颤音从中间开始逐渐出现,这是抒情段落最常见的颤音形态,让长音慢慢活起来。结束型,颤音在句尾逐渐变缓变弱,适合段落收束,让句子轻轻地落地。

练习方法是在一个长音上尝试软件生成颤音,调整延迟和幅度参数听效果。再在下一个长音上画PIT手绘颤音,画三条波浪线,幅度逐渐变小。对比两种方式的听感差异。你会发现软件颤音精确但缺少变化,手绘颤音稍有不规则但更自然。哪种更好?没有标准答案,取决于你需要的效果。

调教教程——第二篇:参数篇(共通篇)

第四章:DYN——音量动态

前面我们学会了PIT和颤音,控制的是音高。现在进入另一个维度,音量、音色、呼吸感,这些参数共同决定了声音的质感。我们先从最直接的DYN开始。

DYN控制音符的音量大小。在VOCALOID中,DYN参数范围通常是0到127。在Synthesizer V中,音量参数以dB为单位或百分比显示。在OpenUTAU中,DYN以百分比或通过音量包络控制。DYN的默认状态通常是固定值,这也是听起来机械的原因之一。自然演唱中音量是持续变化的,没有哪个真人歌手会从头到尾用同一个音量唱歌。

DYN和混音音量的区别要分清楚。DYN是音符级别的控制,影响单个音符的相对音量。混音推子是轨道级别的控制,影响整轨音量。调教阶段用DYN制造演唱的起伏,混音阶段用推子调整整体平衡。两者不冲突,一个管细节,一个管整体。

自然演唱中音量有一些波动规律。上行旋律通常伴随音量增大,下行旋律伴随音量减小。句首起音时有轻微爆发,句尾收束时音量渐弱。副歌段落的音量通常高于主歌段落。在乐句内部,重要字也就是实词,音量通常高于辅助字也就是虚词。这种微小的音量差异会显著影响演唱的自然度。如果你觉得虚拟歌手唱得太平,先检查DYN是不是从头到尾一条直线。

DYN曲线的段落设计可以参考这样的思路。主歌DYN设置在60到80区间,副歌设置在75到95区间,桥段设置在50到70区间。具体数值取决于歌曲的动态范围需求,但不同段落之间的DYN差异应该在15到25之间。DYN曲线应该平滑变化,避免突变。在句与句之间预留换气区域,让DYN自然回落再重新推起。这样每个乐句都有自己的呼吸感。

练习方法:取一段已经完成的MIDI工程,把所有音符的DYN设为统一数值,比如80,听一遍效果。然后在主歌和副歌之间做出15到25的DYN差异,再听一遍效果。你会立刻听到段落之间的层次感出来了。

第五章:BRI/GEN/BRE——音色三参数

DYN管音量,BRI、GEN、BRE管音色。这三个参数是控制虚拟歌手音色的核心,分别影响声音的明亮度、性别感和呼吸感。它们和DYN不同,DYN影响音量大小,BRI、GEN、BRE影响声音的质感。同样的音量,不同的音色,唱出来的感觉完全不同。

BRI是明亮度。BRI值越高,声音越亮、越清脆;BRI值越低,声音越暗、越柔和。在三个软件中的对应关系是:VOCALOID中直接为BRI参数,Synthesizer V中对应为明亮度参数,OpenUTAU中通过表达式系统或flags实现类似效果。BRI的调整范围通常在0到100之间。抒情段落使用较低的BRI值,大约40到60。快节奏段落使用较高的BRI值,大约70到85。摇滚或爆发段落可以使用更高的BRI值,85到100。BRI值过高可能导致声音刺耳,过低可能导致声音发闷。如果你觉得声音太尖锐,降低BRI;太闷,提高BRI。

GEN是性别值。GEN值越高,声音越偏向男性化,更厚、更低;GEN值越低,声音越偏向女性化,更细、更高。在VOCALOID中直接为GEN参数,Synthesizer V中对应为Gender参数,OpenUTAU中通过flags控制,比如g-4、g+4。GEN的调整范围通常在-20到+20之间,不同声库的GEN响应特性不同,需根据实际听感调整。降低GEN值可以使声音变细,在戏腔段落中常用,GEN可以设到-10到-15。

BRE是呼吸度。BRE值越高,声音中气息成分越多,听起来越气声;BRE值越低,声音越干净、越纯声。VOCALOID中直接为BRE参数,Synthesizer V中对应为Breathiness参数,OpenUTAU中通过表达式系统或flags控制。BRE的调整范围通常在0到100之间。抒情段落使用较高的BRE值,20到40。摇滚段落使用较低的BRE值,0到10。句尾渐弱时可以使用更高的BRE值,40到60,制造消散效果。BRE值过高可能导致声音发虚、咬字不清。

练习方法:取一个长音,只调整BRI,从20到80听变化。再取另一个长音只调整GEN,从-20到+20听变化。再取第三个长音只调整BRE,从0到80听变化。记录每种参数在不同数值下的听感变化。这个练习能让你建立起对这三个参数的直观认识。

BRI、GEN、BRE是三个平台的共同参数。但SV和OpenUTAU还有一些进阶参数,本节单独说明。

第六章:张力与气声(SV/OpenUTAU进阶)

张力和气声是Synthesizer V和OpenUTAU中可用的进阶参数。注意,VOCALOID没有直接对应的Tension参数。

Tension是张力。它控制声音的紧张程度。Tension值越高,声音越紧、越有力、越有穿透力;Tension值越低,声音越松、越柔和。在Synthesizer V中直接为Tension参数,在OpenUTAU中可通过flags模拟类似效果,比如t-10、t+10。Tension的调整范围通常在0到100之间。摇滚段落使用较高的Tension值,70到85。抒情段落使用较低的Tension值,30到50。

气声在Synthesizer V中专指Breathiness参数。它控制声音中气息成分的比例,范围通常在0到100之间。这类似于VOCALOID的BRE但响应曲线不同。SV的Breathiness在高数值时声音的气声感更明显,适合抒情段落和句尾收束。

举个例子。在SV中,Tension设为80,Breathiness设为10,出来的声音有力、清晰,适合摇滚和快节奏。Tension设为30,Breathiness设为50,出来的声音柔和、飘散,适合抒情和结尾。在OpenUTAU中,flags的组合可以实现类似的音色变化。建议读者在自己的工程中尝试不同的组合,找到适合当前段落情绪的参数配置。参数没有绝对正确的值,只有适合当前这句词、这段旋律的值。

了解了每个参数的单独作用之后,现在需要把它们组合起来使用。

第七章:参数的组合逻辑

参数不是独立工作的,它们需要组合使用才能产生完整的演唱表现。单独的DYN变化只能制造音量起伏,单独的BRI变化只能改变音色,但当它们按照相同的情绪方向变化时,效果是叠加的。副歌的高DYN配合高BRI和高Tension,出来的声音又响又亮又有力,这才是副歌该有的样子。如果只推DYN,声音响但不亮,情绪还是差一点。

四个参数的组合方向,以全曲变化为参考,可以这样设计。

段落 DYN BRI GEN BRE Tension(SV) 情绪效果

主歌 60-75 40-60 0 10-25 40-55 柔和、叙事

导歌 70-85 55-70 0 10-20 55-70 推进、过渡

副歌 80-95 70-85 0 5-15 70-85 有力、爆发

桥段 50-65 50-65 -5 20-40 30-50 脆弱、转折

尾奏 40-60 45-55 -5 30-50 30-45 消散、收束

参数组合的协作逻辑是:DYN和BRI可以同步变化,副歌同步升高,桥段同步降低。GEN通常保持稳定,只在特殊段落如戏腔才调整。BRE与DYN反向变化,DYN升高时BRE降低,DYN降低时BRE升高。GEN日常调校中可以保持不变,不要每段都动它。

不同风格的参数配置参考如下。

摇滚风格:高DYN,80到95;高BRI,70到85;低BRE,0到10;高Tension,70到85。

抒情风格:中DYN,60到80;中BRI,40到60;中BRE,15到30;低Tension,30到50。

戏腔风格,参考《染暮行》的经验:GEN降低,-10到-15;BRI升高,75到85;DYN中等,70到80;高Tension,85到92。

练习方法:取一段完整的副歌段落,按照上述参数组合方向配置全段参数曲线,导出听效果。然后在主歌和副歌之间做参数对比,感受不同参数组合带来的情绪变化。你会听到,当所有参数朝着同一个方向走的时候,虚拟歌手的演唱突然有了段落感。

参数篇到此结束。你已经在理论基础和参数控制上完成了全部准备。下一篇我们将进入操作篇,分平台说明VOCALOID、Synthesizer V和OpenUTAU的具体调教操作。

调教教程——第三篇:操作篇(分平台)

第八章:VOCALOID调教

前两篇我们学习了调教的理论基础和参数逻辑。现在是时候动手了,在具体软件中实现这些技术。我们先从VOCALOID开始。

VOCALOID Editor中,音符下方可以打开参数曲线面板。这个面板通常位于钢琴卷帘或音符编辑区域的下方,可以通过界面按钮或菜单选项打开。可调节的主要参数包括PIT、DYN、BRI、GEN、BRE。在VOCALOID 4及更早版本中,参数以直线或折线形式显示在音符下方,用户通过拖动控制点来调整曲线。在VOCALOID 6中,界面有所更新,但核心参数和操作逻辑相似。

VOCALOID的PIT绘制方法是这样的。选择PIT参数轨道,点击添加控制点,拖动控制点来绘制曲线。PIT控制点沿时间轴排列,每个控制点可以设置一个偏移值,范围是-100到+100音分。要画出滑音效果,需要在两个音符之间画一条斜线。方法是在前一个音符的尾部添加一个控制点,在后一个音符的头部添加另一个控制点,然后拖动中间的曲线段使其倾斜。注意VOCALOID的PIT控制点是线性插值的,也就是说相邻控制点之间用直线连接,因此需要使用足够多的控制点来实现平滑曲线。画滑音的时候,如果只放两个控制点,中间就是一条直线,听起来可能太硬。可以多放几个控制点,让曲线稍微弯一点,更接近真人滑音的感觉。在VOCALOID 6中,新增了曲线平滑功能,可以自动平滑PIT曲线。

GEN、BRI、BRE在VOCALOID中的设置和我们在参数篇学到的对应关系一致。GEN控制声音的性别感,范围通常在-20到+20之间,降低GEN可使声音变细,戏腔常用GEN等于-10到-15。BRI控制声音的明亮程度,范围0到100,BRI值越高声音越亮,副歌段落适当提高BRI到70至85。BRE控制声音的呼吸感,范围0到100,BRE值越高声音越气声,抒情段落适当提高BRE到20至40,句尾渐弱时使用较高BRE到40至60。

VOCALOID还有一个重音参数。在音符属性中可以设置重音,英文是Accent,用于在特定音符上强调发音。重音参数通常以百分比或数值形式表示,当设置在较高数值时,该音符的发音会更有力、更突出。在快节奏段落的强拍位置设置高重音值,可以增强节奏感。在副歌的核心字上设置中等或较高的重音值,有助于突出关键词。这个参数相当于给某个字单独加了一点DYN和BRI的混合效果,让那个字从整句里跳出来。

练习方法:在VOCALOID中打开一个简单的MIDI工程,依次尝试绘制PIT曲线,在两个相邻音符之间画滑音;调整BRE,在句尾增加呼吸度;设置重音,在副歌强拍音符上加重音。导出听效果,对比调整前后的差异。

VOCALOID的调教方法有了一个清晰的工作流基础,接下来看Synthesizer V。它和VOCALOID有很多相似之处,但在一些细节上不同。

第九章:Synthesizer V调教

Synthesizer V Studio中,每个音符下方可以打开参数曲线面板。参数面板位于钢琴卷帘区域的底部或侧边,可以通过点击音符或轨道设置区域打开。可调参数包括Pitch、Volume、Tension、Breathiness、Gender、Voice Color等。SV的参数曲线支持贝塞尔曲线,控制点之间的过渡比VOCALOID更平滑。这一点很重要,因为贝塞尔曲线意味着你不需要放很多控制点就能画出自然的弧线,一个控制点配合两侧的手柄就能完成VOCALOID里需要五个控制点才能画出的曲线。

SV的PIT绘制方法有手动模式和辅助模式两种。手动模式下,用户直接拖动画笔绘制曲线,想画什么形状就画什么形状。辅助模式下,SV会根据音符的上下文自动生成基础音高线,用户可以在此基础上进行修改。SV的PIT控制点比VOCALOID更密集,支持更精细的曲线调整。SV还支持Pitch Anchor,也就是音高锚点,可以在音符内部固定某些位置,防止在该位置出现偏离。比如你想让一个长音的前半段完全稳定,只在后半段加装饰,就在中点放一个锚点,前半段就不会被误动。

Tension和Breathiness在SV中的使用和参数篇讲的一致。Tension控制声音的紧致程度,范围0到100。摇滚段落Tension设置在70到85,抒情段落设置在30到50。Breathiness控制声音的气息成分,范围0到100。抒情段落的Breathiness设置在20到50,副歌爆发段落设置在5到15,句尾消散设置在40到70。在SV中,Tension和Breathiness可以组合使用。Tension高加Breathiness低产生有力的声音,适合副歌。Tension低加Breathiness高产生飘散的声音,适合句尾或桥段。

Voice Color与Tone Shifting是SV的进阶用法。Voice Color参数可以微调声库的音色特性,范围通常为-100到+100。正值使声音更明亮,负值使声音更暗淡。Tone Shifting可以将整个声部的音高整体偏移,以音分为单位,主要用于调整声库在不同音区的响应,但通常保持为0。Voice Color在戏腔段落中可以使用正值,+10到+30,增强明亮感。这个参数和BRI类似但有区别,BRI是整体明亮度,Voice Color更像是微调音色的性格。

SV内置了AI音高生成功能,可以自动为音符生成基础音高线。推荐工作流是先用SV自动生成基础音高线,使用Auto Pitch或Pitch Generation功能,然后人工修正不够自然的部分。在需要精确控制的地方,比如字与字之间的滑音、音头的甩腔等,手动绘制或调整PIT曲线。在不需要精细控制的地方,比如过渡音或次要音符,保留AI生成的曲线,避免过度调教浪费时间和精力。这个工作流和VOCALOID完全不同,VOCALOID是从零开始画,SV是先生成一个还不错的底子再修。

练习方法:在SV中导入一个MIDI工程,启用自动音高生成功能,听一遍基础效果。然后在主歌的第一句手动调整PIT曲线,尝试先降后升的滑音。在副歌的最后一句增加Breathiness,导出听效果。对比自动生成和手动修正后的差异。

SV的自动音高线工作流和VOCALOID的手动绘制思路不同。现在看第三个平台:OpenUTAU,它的调教方式更偏向flags和表达式系统。

第十章:OpenUTAU调教

OpenUTAU使用表达式系统来控制参数。在钢琴卷帘中,音符下方可以添加不同的表达式轨道,如Pitch、DYN、BRI、BRE等。OpenUTAU的表达式曲线支持控制点编辑,控制点之间可以设置为线性或平滑插值。表达式系统的灵活性高于VOCALOID和SV,用户可以自定义参数映射和曲线形状。如果你愿意,甚至可以把某个参数映射到一个完全不同的控制维度上。

flags是OpenUTAU特有的概念。flags是传递字符串参数给重采样器的方式,用于控制声音的合成效果。常见的flags包括g、t、h、E。g控制性别或共振峰,g+4表示提高共振峰使声音更明亮,g-4表示降低共振峰使声音更低沉。t控制张力,类似SV的Tension,t+10表示增加张力。h控制呼吸度,h+20表示增加呼吸感。E控制清晰度,E+5表示增加清晰度。在表达式中,flags通过字符串形式输入,例如g-4t+10h+20表示降低性别值、增加张力、增加呼吸度。flags的数值范围和响应曲线取决于使用的重采样器,不同重采样器对同一flags的响应可能不同。这一点要特别注意,你在一台电脑上调好的flags,换一个重采样器可能完全变味。

表达式和flags是两种不同的控制方式。表达式是曲线参数,可以在音符级别随时间变化,比如DYN曲线上升和下降。flags是静态参数,作用在整个音轨或整个工程上。在调教时,使用flags设置音色的基本状态,比如整体性别值或张力,使用表达式控制音色的动态变化,比如在某段落的亮暗变化、音量起伏。简单说,flags定基调,表达式做变化。

重采样器与音素器也需要了解。重采样器负责将声库的采样转换成目标音高的声音。常用的重采样器有fresamp、TIPS、moresampler等,它们对flags和声音质量的响应各不相同。音素器负责将歌词转换为音素序列,支持多种语言的音素转换。在OpenUTAU中,选择适当的音素器和重采样器组合是获得良好听感的基础。在开始调教前,确认音素器与声库的语言匹配,确认重采样器与flags兼容。如果发现声音怎么调都不对,先检查这两个选择是否正确,往往问题不在参数而在引擎。

OpenUTAU支持预渲染功能,可以在编辑时在后台渲染音频,快速预览效果。工作流是在编辑音符或参数时,启用预渲染,在播放时听到已渲染的音频,而不是实时合成。这可以节省等待时间,提高调教效率。预渲染在频繁调整参数时尤为有用,减少因实时合成导致的卡顿或延迟。

练习方法:在OpenUTAU中加载一个UTAU声库,在表达式中添加Pitch曲线,在两个相邻音符之间画滑音。在flags中设置g-4t+10,性别降低、张力增加。预渲染并导出听效果。然后尝试更换重采样器,对比不同重采样器对同一flags的响应差异。

至此,三个平台的调教操作已经全部覆盖。你已经了解了它们的核心工作方式和调校逻辑。通过对比可以发现,三个平台的操作方式虽然有差异,但底层逻辑是一致的,都是通过控制音高曲线、音量动态、音色参数来调整虚拟歌手的演唱表现。VOCALOID是参数轨道,SV是曲线编辑,OpenUTAU是表达式加flags,它们走的是三条不同的路,但共同目标是让声音从平直变得有起伏。掌握了这些,你可以根据手头的工具和工程需求自由切换,而不需要重新学习一套新的理论。下一篇是进阶篇,我们讨论特定场景的调教技巧:戏腔、快节奏和抒情段落。

调教教程——第四篇:进阶篇

第十一章:戏腔调教(共通)

三个平台的操作方式已经了解清楚了。现在进入进阶篇:针对特定场景的调教技巧。本章讲戏腔,这是术力口调教中最具挑战性也最有趣的场景之一。

戏腔需要模拟戏曲唱腔的某些特征,高亢、婉转、有滑音和甩腔。虚拟歌手的默认演唱方式不包含这些特征,因此需要通过调教来制造戏腔效果。换句话说,不是声库自带了戏腔模式,而是我们通过一系列操作把普通的声音“逼”成戏腔。

戏腔调教的核心技术分四步。

第一步是升高八度。戏腔听起来高亢,最直接的方式是把整个段落的音符提高一个八度。注意,这只是为了获得戏腔的音色特征,实际音高以听觉舒适为准。不是所有戏腔都必须唱在极高音区,但高音区确实更容易出来那种尖锐、穿透的感觉。如果你发现升高八度之后太刺耳,可以只升五度,或者保持原音高但加强后面的音色处理。

第二步是元音替换。戏腔的咬字比普通演唱更开,某些元音需要替换。e要换成uo。比如“这”唱成“zhuo”,“和”唱成“huo”,“可”唱成“kuo”,“歌”唱成“guo”,“得”唱成“duo”。原理是e元音的发声位置偏前、偏扁,uo元音更圆润、更开阔,更接近戏曲的咬字方式。这一步在VOCALOID的歌词输入界面直接修改拼音即可。Synthesizer V和OpenUTAU中也可以直接修改歌词或调整音素。这一步在Synthesizer V中不是必须的,因为SV支持直接输入汉字,自动转换发音,但在VOCALOID和OpenUTAU中需要手动处理。如果你想让戏腔味更浓,SV里也可以手动改成uo的发音。

第三步是滑音处理。戏腔中字与字之间的滑音比普通演唱更明显、更夸张。PIT曲线应该画得比普通段落更陡,滑音范围通常在半音到两个半音之间,也就是50到200音分。可以使用先降后升的PIT形态,音头先低于目标音再上滑,也可以使用先升后降的形态,音头先高于目标音再下滑。关键是要比普通段落更夸张,普通段落里滑音可能只需要20到30音分,戏腔里要翻好几倍。

第四步是PIT上行甩腔。在句末或重要字上画PIT上行曲线,制造甩腔效果,类似于戏曲中句尾的向上抛腔。甩腔的上升幅度通常在100到300音分之间,持续时间约为该字时值的三分之一到二分之一。这是戏腔最具辨识度的特征之一,那一甩出去的高音就是戏味的来源。

我在《染暮行》里实际用过这些技术。三句戏腔的调教参数可以参考。第一句“都化作一剑出”的“剑”字使用了A4到D5上行甩腔,幅度约400音分,时值延长至附点二分,Tension全程85%到92%。第二句“青丝成雪”的“雪”字使用了A4到B4再到A4的V形弧线,Tension从65%渐变到85%。第三句“一往无顾”的“顾”字使用了B4到A4到F#4再到D4缓慢下行五度,无颤音,Tension从80%降到20%,Breathiness从5%升到40%。这三个字分别示范了甩腔、V形弧线和下行消散三种戏腔收尾方式。你的戏腔段落不需要完全复制这些参数,但它们提供了一个参考坐标。

戏腔的调教需要夸张的滑音和音色控制。接下来讨论另一个常见场景:快节奏段落。这里的核心问题是如何让虚拟歌手在密集的音符中保持清晰。

第十二章:快节奏段落调教

快节奏段落中音符密集,虚拟歌手容易吞字或发音模糊,听感上像机器在念一串音节。调教需要特别关注咬字清晰度。如果一段快歌唱完,你只听清了不到一半的字,那这段调教就是失败的。

声母时值压缩是第一要务。在快节奏段落中,声母也就是辅音的时值应该缩短,让元音更快地出现。在VOCALOID中,可以通过音符属性中的辅音时长参数调整。在SV中,通过音符属性中的辅音时长或音素边界调整。在OpenUTAU中,通过调整音素边界完成。目标是让每个字的头更短,身体更快出现。声母短了,元音就能在有限的时间里占到更多份额,咬字自然就清楚了。

元音缩短也需要注意。在极快速度的段落,比如160BPM以上,连元音也需要缩短,防止听感黏连。通常缩短到原时值的60%到80%。注意,不是所有元音都要缩短,主要在密集度最高的段落使用。缩短元音后,整句听起来会更干脆,不会拖泥带水。但如果缩短过度,会让声音变碎,所以要从60%到80%这个区间开始尝试。

重音参数的使用能帮上大忙。在VOCALOID中,快节奏段落的强拍位置应该设置较高重音值,增强节奏感。在副歌的快节奏段落,重音参数通常设置在80到100之间,使强拍更突出,增强节奏感。在SV中可通过提高DYN来实现类似效果,在OpenUTAU中通过音量表达式或flags控制。强拍上的字被加重了,弱拍上的字自然就变成了陪衬,整句的节奏骨架就出来了。

快节奏段落的PIT曲线有自己的特点。快节奏段落中,PIT曲线不需要复杂滑音。相邻音符之间画短促的直线连接即可,而不是长曲线。连接型PIT的时值占比应该缩短,避免滑音占用过多时间。如果在快歌里画太多滑音,字与字之间会黏在一起,反而更不清晰。快歌的PIT原则是够用就好,点到为止。

快节奏需要清晰和干脆。抒情段落正好相反,需要柔和和呼吸感。下面讨论抒情段落的调教。

第十三章:抒情段落调教

抒情段落速度慢、情绪浓,虚拟歌手在慢速段落中更容易暴露机械感,因为每个音都被拉长,缺乏起伏会更加明显。一个三拍的长音,如果从头到尾PIT平直、DYN不变、BRE为零,听起来就像机器在鸣笛。调教需要增加气声、颤音、弱唱等细节,让长音活起来。

气声与弱唱是抒情段落的核心。抒情段落的核心是柔。增加Breathiness,也就是VOCALOID的BRE、SV的Breathiness、OpenUTAU的h flags,让声音有呼吸感。句首使用中等Breathiness,20到30,句尾使用较高Breathiness,40到60。弱唱是指在句尾或次要字上降低音量,DYN降低到50到60,制造轻声效果。句尾的弱唱特别重要,它模拟了真人歌手在句尾自然收力、让声音消散的感觉。

Breathiness的段落应用要有起伏。在抒情段落的起始句,Breathiness设置在20到30。在句尾的长音上,Breathiness逐渐升高到40到60,模拟歌手在句尾的换气或气息释放。注意Breathiness不要在整个段落中保持恒定,应该随句子的情绪起伏而变化。如果整段都是一样的气声量,听感会变成一层不变的雾。句首清晰一点,句尾气声多一点,这样每个乐句都有自己的呼吸节奏。

颤音变缓是抒情段落的关键。在抒情段落中,颤音应该比快节奏段落更慢、更宽。软件生成颤音时,将颤音频率降低到4到5Hz,从默认的5到6Hz降下来,将颤音幅度增大到15到25音分,从默认的5到15音分加上去。手绘PIT颤音时,波浪线的周期应该更长,幅度应该更大。在抒情段落的句尾长音上,使用结束型颤音,颤音在长音的末尾逐渐变缓变弱,然后消散。这种渐弱的颤音是抒情句尾最自然的收束方式。

练习方法:取一段8小节的抒情旋律,按照上述方法增加Breathiness,句首20到30,句尾40到60;降低颤音频率到4到5Hz;增大颤音幅度到15到25音分。导出听效果。然后比较处理前后三个指标的差异:机械感是否减少,情绪是否更浓,声音是否更贴近人声。你会发现长音不再像鸣笛了,而像一个歌手在轻轻地把每个字送出来。

进阶篇到此结束。你已经在理论和操作上完成了全部准备,从发音、PIT、颤音到参数组合,再到三个平台的具体操作,最后到戏腔、快节奏和抒情段落的进阶技巧。下一篇是实战篇,我们把这些知识整合起来,完成一个完整的调教流程。

调教教程——第五篇:实战篇

第十四章:调教流程

前四篇我们覆盖了调教的所有知识和技巧。现在是时候把它们整合起来,完成一次完整的调教练习了。本章的目标是完成一首16小节的完整歌曲调教。歌曲结构为:主歌8小节,副歌4小节,桥段4小节可选。练习分为七个步骤,按顺序完成。

调教流程的整体逻辑是:调教不是从第一个音符改到最后一个音符,而是分层推进。第一层处理音准和滑音,也就是PIT。第二层处理音量和动态,也就是DYN。第三层处理音色,也就是BRI、GEN、BRE、Tension。第四层处理细节,也就是颤音、呼吸感、句尾处理。每一层都在前一层的基础上叠加,最终形成完整的演唱表现。不要试图一个音符一个音符地一次性调完所有参数,那样效率极低,而且很难保持整体的一致性。

步骤一:检查歌词和发音

拿到MIDI工程后,先播放一遍,确认所有歌词都已经正确填入,没有遗漏或错位。检查是否有“啦”或空白音符未填。如果有,补填歌词。检查是否有明显发音错误,比如声母或韵母拼写错误,像“zhe”写成“ze”。这一步确保发音准确,是后续调教的基础。发音错了,后面调得再细也没用。

步骤二:逐句调整PIT

从第一句开始,逐句绘制PIT曲线。先画连接型PIT,在两个相邻音符之间画平滑曲线,让前一个音的尾部滑向下一个音的头。遵循声调走向原则:去声字滑音从上到下,阳平字滑音从下到上。再画修饰型PIT,在句首或重点字上添加先降后升或先升后降的修饰。副歌的核心句可以画得更夸张一些,滑音范围更大。一句调完听一句,确认效果后再调下一句。不要一口气画完整首,那样出了问题很难定位。

步骤三:配置DYN曲线

播放整段旋律,标记出主歌、副歌、桥段的边界。在主歌设置DYN为60到75,在副歌设置DYN为80到95,在桥段设置DYN为50到65。在主歌内部,句首音量略高、句尾略低,制造自然的起伏。在副歌内部,核心句的DYN推到最高值,过渡句回到中等值。在桥段内部,DYN逐渐降低,为最后的副歌或收束做准备。DYN曲线应该平滑变化,不要突变。突然的音量跳变会让听众吓一跳。

步骤四:配置BRI/GEN/BRE

播放整段旋律,根据段落情绪配置音色参数。主歌BRI为50到65,GEN为0,BRE为15到25,柔和、叙事。副歌BRI为70到85,GEN为0,BRE为5到15,有力、明亮。桥段BRI为50到65,GEN为-5,BRE为25到35,脆弱、转折。如果有SV的Tension参数,主歌40到55,副歌70到85,桥段30到50。这些数值不是死的,根据实际听感微调。

步骤五:添加颤音和细节

在长音上添加颤音,可以用软件生成或手绘PIT。抒情段落使用较慢的颤音,4到5Hz,幅度15到25音分。快节奏段落使用较快颤音,5到6Hz,幅度5到15音分,或者省略颤音。句尾处理方面,在句尾的长音上,DYN逐渐降低、BRE逐渐升高、颤音逐渐变缓变弱。句首处理方面,在句首的音头上,添加微小的先降后升PIT修饰。这些细节是让声音从“能用”到“好听”的关键。

步骤六:整体播放与修正

从头到尾播放整段调教完成的工程。注意检查:发音是否清晰,是否有机械感,段落之间是否有情绪变化,句与句之间是否有呼吸感,长音是否处理得当。标记出听起来不顺的位置,逐句返回修改。重点检查强拍位置的音符,也就是实词,是否被强调;句末的弱拍音符,也就是虚词,是否自然地淡化。这个阶段需要反复听,耳朵是最终的判断标准。

步骤七:导出干声

确认所有调整完成后,导出虚拟歌手的人声干声,不带伴奏。在VOCALOID、SV、OpenUTAU中,导出时勾选“仅人声”或“只导出选定轨道”。保存工程文件,命名为“歌曲名_tuning_v1”,将导出的干声和工程文件一起存档。导出前对照检查清单逐项核对,检查清单附在本章末尾。

练习的交付物

完成练习后,你应该产出三样东西:一份完成调教的工程文件,一段导出的干声,WAV格式,一份完成的工作记录,记录每步操作做了什么。工作记录不用很详细,但要有,方便以后回看和排查问题。

调教检查清单

导出干声前,逐项核对:

- [ ] 所有音符的歌词已正确填入,无遗漏

- [ ] PIT曲线已绘制,相邻音符之间已有滑音连接

- [ ] 句首音头已做修饰,先降后升或先升后降

- [ ] 句尾长音已有颤音,软件生成或手绘PIT

- [ ] 句尾长音已做渐弱处理

- [ ] DYN已配置,主歌和副歌之间有明显的音量差异

- [ ] BRI已配置,不同段落之间有明显的亮暗对比

- [ ] BRE已配置,抒情段落的呼吸感足够

- [ ] 发音清晰,无明显的声调错误或吞字

- [ ] 从头到尾播放一遍,机械感已明显减少

- [ ] 工程文件已保存

- [ ] 干声已导出,WAV格式

完成了完整的调教流程之后,你可能会遇到一些常见问题。本章汇总了调教中最常遇到的问题及解决方法。

第十五章:常见问题与解决方案

问题1:中文声调不对怎么办?

表现是某个字唱出来听起来像另一个字,比如“妈”唱成“骂”。原因通常是声调走向和旋律走向相反。解决方法是检查该字的声调,阴平、阳平、上声还是去声,然后调整PIT曲线的方向。去声字画下行,阳平字画上行,上声字画V形。如果调整PIT后仍然不对,检查歌词输入是否使用了正确的拼音,比如“zhe”错写成“ze”。拼音错了,调什么都没用。

问题2:发音模糊、吞字怎么办?

表现是某些字听不清,像被吞掉了。原因通常是声母时值过短或过长。解决方法是在VOCALOID或SV中调整辅音时长参数,缩短过长的辅音,或延长过短的辅音。在OpenUTAU中调整音素边界。对于爆破音,比如b、p、d、t、g、k,辅音时值极短,调整范围有限。对于摩擦音,比如s、sh、f、h,可以适当延长辅音时长增加清晰度。如果某个字怎么调都听不清,试试在它前面加10到20毫秒的空白,让声母有释放空间。

问题3:找不到合适的参数组合怎么办?

表现是调了很久参数,但声音听起来总是不对。解决方法是参考第七章的组合表,确定目标风格后,先在表中找到对应的参数数值范围,在这个范围内逐步微调。每次只调整一个参数,找到合适值后再调整下一个。每次调整以一小段旋律为单元,不超过4个小节,不要一次性调整全曲。如果一个参数调了很多次都不对,可能问题不在这个参数,换一个试试。

问题4:PIT曲线画完还是像机器人怎么办?

表现是已经画了PIT,但声音听起来仍然机械。原因通常是忽略了DYN和BRE等动态参数。解决方法是检查DYN是否有起伏,确保主歌和副歌之间有明显音量差异。增加BRE让句尾有散开的感觉。检查颤音是否存在,如果软件生成颤音不起作用,尝试手绘PIT颤音。确认三个层次的调教是否都已覆盖,音高、音量、音色缺一不可。PIT只是三分之一的工作。

问题5:参数调了但听不出变化怎么办?

表现是修改了参数数值,但耳朵没有感知到变化。原因通常是调整幅度太小或调整位置不正确。解决方法是先做大幅度调整,比如DYN从60直接调到90,确认变化方向正确后再微调回合适的数值。确认调整的参数是否确实在该段落中生效,比如你调整了副歌的DYN,但播放的是主歌段落。如果调整后仍听不出变化,可能该参数在当前声库或当前音区的响应较弱,尝试换一个参数,比如用BRI替代DYN来制造段落差异。

最终练习建议:在完成一首歌的完整调教后,将工程放置1到2天再听。重新打开工程,从头到尾听一遍,记录下仍然不顺的位置,再次修改。建议每次完整调教后都做一次放置、回听、微调的循环。通常2到3次循环后,歌曲的听感会显著提升。耳朵会疲劳,放一放再回来,你会听到之前听不到的问题。

调教教程的全部内容到此结束。你已经掌握了从零开始完成一首歌曲调教所需的所有核心知识和技能:发音与元音、PIT曲线、颤音、DYN/BRI/GEN/BRE参数、三大平台的操作方法、戏腔/快节奏/抒情段落的进阶技巧、完整的调教流程和常见问题排查。附录中提供了三大软件参数对照表、常用中文声调PIT绘制参考、快捷键速查和术语中英对照表,供你在实际调教中查阅。

附录A:三大软件参数对照表

下表列出了VOCALOID、Synthesizer V和OpenUTAU中主要调教参数的对应关系,方便你在不同平台之间切换时快速找到对应的控制项。

| 功能 | VOCALOID | Synthesizer V | OpenUTAU |

|------|----------|---------------|----------|

| 音高修正曲线 | PIT参数 | Pitch曲线 | 表达式(Pitch deviation) |

| 音量动态 | DYN | 音量参数(Volume) | DYN表达式 / 音量包络 |

| 明亮度 | BRI | 明亮度(Brightness) | BRI表达式 / flags(b+) |

| 性别值 | GEN | Gender | flags(g+ / g-) |

| 呼吸度 | BRE | Breathiness | BRE表达式 / flags(h+) |

| 张力 | 无直接对应 | Tension | flags(t+) |

| 清晰度 | CLE | 清晰度(Clearness) | flags(E+) |

| 气声 | BRE(部分) | Breathiness | flags(h+) |

| 重音/强调 | 重音参数(Accent) | 通过DYN/张力模拟 | 通过DYN表达式模拟 |

| 颤音(软件生成) | 音符属性中的颤音参数 | 颤音曲线编辑器 | 表达式系统 / flags |

| 音素/发音修正 | 音符属性中调整辅音时长 | 音符属性中调整音素边界 | 手动调整音素边界 |

| 戏腔参数 | BRI升高、GEN降低 | Tension升高、Breathiness降低 | flags组合(g-t+h+) |

注:各平台的具体参数名称和范围可能因版本不同而有差异,以上为通用的对应关系。

附录B:常用中文声调PIT绘制参考

本附录提供常见中文声调和语调类型的PIT绘制参考。

四声基本走向

| 声调 | 例字 | PIT绘制方式 | 音高变化范围(参考) |

|------|------|------------|---------------------|

| 阴平(一声) | 妈、天、风 | 保持平直,微小波动即可 | 0-10音分 |

| 阳平(二声) | 麻、人、明 | 从低到高上行 | +30到+80音分 |

| 上声(三声) | 马、我、好 | 先降后升(V形) | -30到+50音分 |

| 去声(四声) | 骂、是、落 | 从高到低下行 | +30到-50音分 |

常用语调类型的PIT形态

强调字(重音):在字头快速上滑(+50到+100音分)后回到目标音,模拟“加重”语气。

句末上扬(疑问):在句末字上画出上扬弧线(+30到+60音分),模拟疑问语气。句末下降(陈述):在句末字上画出下降弧线(-30到-60音分),模拟陈述结束感。

叹词处理:在“啊”“哦”“嗯”等叹词上画出较长的滑音弧线,通常先升后降。

戏腔甩腔(参考《染暮行》经验):在句末或重点字上画出上行曲线(+100到+300音分),时值占该字总时值的1/3到1/2。通常在句末使用甩腔效果更明显。

哭腔:在长音上画出波浪形PIT曲线,幅度约20-40音分,频率约5-6Hz,配合BRE增加(40-60)。

注意事项:以上数值为参考范围,不是精确标准。具体画法需根据旋律的实际音高和节奏来调整。在绘制过程中通过实际听感来修正比直接套用数值更可靠。

附录C:调教快捷键速查

VOCALOID

| 操作 | 快捷键(Windows) |

|------|-----------------|

| 播放/暂停 | 空格键 |

| 选择工具 | S |

| 铅笔工具 | P |

| 橡皮工具 | E |

| 撤销 | Ctrl+Z |

| 重做 | Ctrl+Y |

| 复制 | Ctrl+C |

| 粘贴 | Ctrl+V |

| 剪切 | Ctrl+X |

| 放大 | Ctrl++ |

| 缩小 | Ctrl+- |

| 全屏播放 | Enter |

| 音符分割 | 右键 + 分割选项 |

Synthesizer V

| 操作 | 快捷键(Windows) |

|------|-----------------|

| 播放/暂停 | 空格键 |

| 停止 | Ctrl+空格 |

| 选择工具 | V |

| 铅笔工具 | N |

| 橡皮工具 | E |

| 撤销 | Ctrl+Z |

| 重做 | Ctrl+Y |

| 复制 | Ctrl+C |

| 粘贴 | Ctrl+V |

| 放大 | 滚轮向上 |

| 缩小 | 滚轮向下 |

| 切换参数视图 | P |

OpenUTAU

| 操作 | 快捷键(Windows) |

|------|-----------------|

| 播放/暂停 | 空格键 |

| 停止 | Shift+空格 |

| 选择工具 | V |

| 铅笔工具 | N |

| 橡皮工具 | E |

| 撤销 | Ctrl+Z |

| 重做 | Ctrl+Y |

| 复制 | Ctrl+C |

| 粘贴 | Ctrl+V |

| 剪切 | Ctrl+X |

| 切换音素视图 | L |

注:macOS系统将Ctrl替换为Command。

附录D:常用术语中英对照表

| 中文 | 英文 | 说明 |

|------|------|------|

| 调教 | Tuning | 调整虚拟歌手参数使其演唱更自然的过程 |

| 音高线 | Pitch Curve / PIT | 控制音符在时间轴上的音高变化曲线 |

| 音量动态 | Dynamics / DYN | 控制音符音量随时间变化 |

| 明亮度 | Brightness / BRI | 控制声音的明亮程度 |

| 性别值 | Gender / GEN | 控制声音的性别感 |

| 呼吸度 | Breathiness / BRE | 控制声音中气息成分的比例 |

| 张力 | Tension | 控制声音的紧致程度 |

| 气声 | Breathiness | 声音中气息成分的听感 |

| 颤音 | Vibrato | 声音在目标音高附近的小幅周期性摆动 |

| 滑音 | Glide / Portamento | 从一个音滑向另一个音 |

| 甩腔 | Pitch Bend Up | 音高向上甩出 |

| 元音 | Vowel | 发音时气流不受阻碍的音素 |

| 辅音 | Consonant | 发音时气流受到阻碍的音素 |

| 声母 | Initial | 汉语拼音中音节开头的辅音部分 |

| 韵母 | Final | 汉语拼音中音节除声母外的部分 |

| 声调 | Tone | 汉语中字音的高低升降变化 |

| 依字行韵 | Tone-Melody Matching | 声调走向与旋律走向对齐的原则 |

| 拆音 | Note Splitting | 将一个字拆成多个音符演唱 |

| 波形 | Waveform | 声音信号的波形表示 |

| 预渲染 | Pre-render | 提前渲染音频以便快速预览 |

| 表达式 | Expression | OpenUTAU中用于控制参数的曲线系统 |

| flags | flags | OpenUTAU中传递给重采样器的字符串参数 |

| 重采样器 | Resampler | 将声库采样转换成目标音高的声音的模块 |

| 音素器 | Phonemizer | 将歌词转换为音素序列的模块 |

| 干声 | Dry Vocal | 未添加效果器的人声原始录音/合成 |

| 导出 | Render / Export | 将工程输出为音频文件 |

附录E:软件下载与资源获取

VOCALOID / Synthesizer V / OpenUTAU 相关资源

VOCALOID及声库资源站:pan.vocaloid.world

网址:pan.vocaloid.world

说明:该站点提供VOCALOID系列编辑器及声库的下载资源。请根据自身需求选择合法版本。

Synthesizer V相关资源:可在pan.vocaloid.world查找Synthesizer V Studio及声库文件,或访问DREAMTONICS官网获取正版信息。

OpenUTAU官方网站:https://openutau\.com

说明:OpenUTAU的官方网站,提供Windows、macOS、Linux版本的下载。开源免费。

OpenUTAU GitHub仓库:https://github\.com/stakira/OpenUtau

说明:OpenUTAU的源代码仓库,如需最新开发版或自行编译,可在此获取。

OpenUTAU 手机版 GitHub仓库:https://github\.com/vocoder712/OpenUtauMobile

说明:OpenUTAU Mobile的GitHub仓库。支持Android 5.0及以上。当前处于V2重写阶段,master分支为旧版(legacy mode),活跃开发在dev分支。软件目前尚不稳定,使用时需经常保存。

OpenUTAU 官方Wiki:https://github\.com/stakira/OpenUtau/wiki

说明:OpenUTAU的官方Wiki,包含快速入门、重采样器、音素器、常见问题等完整文档。

B站学习资源:在B站搜索“VOCALOID调教教程”“Synthesizer V教程”“OpenUTAU教程”“术力口调教”等关键词,可找到大量视频教程。建议优先关注播放量较高的系统性系列教程。

注意事项:虚拟歌手声库和编辑器的使用需遵守各软件和声库的授权协议。使用OpenUTAU时,注意其支持的声库格式(UTAU声库、DiffSinger、ENUNU/NNSVS、Vogen等)。使用手机版OpenUTAU时,请注意随时保存工程文件。

附录F:常用PIT曲线形状速查表

本附录提供常见声调和语调类型在PIT曲线中的绘制参考。PIT曲线以半音为单位,正值表示高于目标音高,负值表示低于目标音高。

一、四声基本走向

阴平(一声):声调平直,PIT曲线基本保持水平,可有微小波动(±5音分以内)

示例字:妈、天、风、光

绘制方式:在音符长度内保持一条直线,或在中段画极小幅度的波浪(<5音分)

阳平(二声):声调上行,PIT曲线从低到高平滑上升

示例字:麻、人、明、长

绘制方式:在音符的前1/3处开始上行,到音符结束前到达最高点。上行幅度通常为+30到+80音分

注意:不要从音符开头就直接上升,自然演唱的阳平字是先略微稳定再上扬的

上声(三声):声调先降后升,PIT曲线呈V形

示例字:马、我、好、永

绘制方式:先下降到-30到-50音分,再上升到+30到+50音分。下降和上升各占音符时值的一半左右

注意:V形的最低点应该在音符的中段稍偏前的位置,不要让最低点出现在音符的2/3之后

去声(四声):声调下行,PIT曲线从高到低平滑下降

示例字:骂、是、去、落

绘制方式:在音符的前1/4处从最高点(+30到+50音分)开始下降,到音符结束前到达最低点(-30到-50音分)

二、常用语调类型的PIT形态

强调/重音:音头快速上滑后回落到目标音

绘制方式:在音符开始的5-10%时值内,从+50到+100音分快速下降回0

适用位置:副歌强拍字、核心情绪字、需要突出的实词

示例效果:在“我 不 想”的“不”字上画这个形态,会让“不”字特别有力量

疑问/句末上扬:在句末字上画上扬弧线,制造疑问语气

绘制方式:在句末字的尾部,PIT从0上升到+30到+60音分,呈缓慢的弧形

适用位置:问句末尾、不确定的陈述句尾

陈述/句末下降:在句末字上画下降弧线,制造陈述结束感

绘制方式:在句末字的尾部,PIT从0下降到-30到-60音分,呈缓慢的弧形

适用位置:叙述段落的句尾、段落的结束

感叹/强情绪:音头快速上冲后回落,然后缓慢下行

绘制方式:音头+80到+120音分快速上升(10%时值),回落到+20音分(20%时值),然后缓慢下降到-20音分(剩余时值)

适用位置:感叹句、情绪爆发点、副歌最高音

叹词处理(啊、哦、嗯):较长的滑音弧线,通常先升后降

绘制方式:在叹词的第一个音上画从0上升到+40到+60音分(占30%时值),然后缓慢下降到-20音分(占70%时值)

适用位置:句首叹词、段落开头

戏腔甩腔(参考《染暮行》经验):在句末或重点字上画上行曲线,上行幅度+100到+300音分

绘制方式:在字的前半段保持稳定,在后半段快速上滑,上滑部分占该字总时值的1/3到1/2

适用位置:戏腔段落的句末字、重要情绪字

注意:甩腔的时值必须足够长,至少二分音符以上。如果音符太短,甩腔效果出不来

哭腔:在长音上画波浪形PIT曲线,幅度20-40音分,频率5-6Hz

绘制方式:在长音的中后段画3-5个波浪,每个波浪上升和下降各占一半,波浪幅度从30音分逐渐减小到10音分

适用位置:抒情段落的句尾长音、悲伤情绪的高点

配合:增加BRE到40-60,降低DYN到50-65

三、PIT绘制的通用原则

1. 先画连接型PIT(字与字之间的滑音),后画修饰型PIT(字内装饰)

2. 连接型PIT的幅度通常为20-50音分,过大则像跑调

3. 修饰型PIT的幅度通常为30-100音分,视情绪强度而定

4. 快速段落中PIT曲线更短促,慢速段落中PIT曲线更舒展

5. PIT曲线应平滑,避免尖角突变

6. PIT曲线在句末应自然收束,不要在中途突然中断,也不要超出音符范围

四、不同段落类型的PIT密度参考

段落类型 PIT曲线密度 修饰频率

主歌(叙事) 较低,主要是连接型PIT 每2-4句一次

导歌(推进) 中等,开始加入修饰型PIT 每1-2句一次

副歌(爆发) 较高,连接型和修饰型交替使用 每句1-2次

桥段(转折) 中等偏低,注重单句内的变化 每1-2句一次

尾奏(收束) 低,主要是连接型PIT和收束 每4句一次

附录G:虚拟歌手声库音域参考表

本附录列出常见虚拟歌手声库的推荐音域、擅长风格和发声特点,帮助填词者根据声库特性选择合适的音区和风格。音域范围仅供参考,实际使用需根据声库版本和调校精度调整。

一、Synthesizer V声库

GUMI SV2

· 推荐音域:C4-E5(流行),G3-B4(摇滚/叙事)

· 擅长风格:全能型,摇滚、流行、抒情、古风

· 发声特点:声音通透,各音区均衡,高音区有金属质感,低音区温暖

· 多音色模式:Default(标准)、Ballad(抒情)、Soft(柔和)、Vivid(生动)、Downer(低沉)、Power(力量)、Whisper(耳语)

· 备注:当前使用的主力声库,在《染暮行》中已实践过

洛天依(Synthesizer V版)

· 推荐音域:D4-D5(中文古风),A3-C5(流行)

· 擅长风格:古风、流行、叙事

· 发声特点:清澈明亮,高音区舒适,中低音区偏薄

· 适合:需要清晰中文咬字的古风歌曲

· 备注:中文声库,少女音

诗岸

· 推荐音域:E4-D5

· 擅长风格:治愈系、流行、轻摇滚

· 发声特点:空灵、干净

· 备注:五维介质“土”元素,适合抒情和治愈风格

星尘(Synthesizer V版)

· 推荐音域:D4-D5

· 擅长风格:电子、流行、史诗风

· 发声特点:略带电子感,中高音区有力

· 备注:五维介质“以太”元素,适合电子风格

苍穹

· 推荐音域:C4-C5

· 擅长风格:流行、叙事

· 发声特点:温暖、沉稳、偏成熟

· 备注:五维介质“气”元素

海伊

· 推荐音域:D4-D5

· 擅长风格:流行、电子、古风

· 发声特点:明亮、空灵

· 备注:五维介质“水”元素

赤羽

· 推荐音域:E4-E5

· 擅长风格:摇滚、流行

· 发声特点:力量感强、声音集中

· 备注:五维介质“火”元素

二、VOCALOID声库

洛天依(VOCALOID版)

· 推荐音域:D4-C5

· 擅长风格:古风、流行

· 发声特点:需配合GEN参数调整音色,默认偏薄

· 备注:中文VOCALOID代表

言和(VOCALOID版)

· 推荐音域:D4-C5

· 擅长风格:快节奏、说唱、电子

· 发声特点:中性音色,咬字清晰度高

· 备注:节奏感强的段落适用

乐正绫

· 推荐音域:E4-C5

· 擅长风格:摇滚、流行、古风

· 发声特点:穿透力强,高音区明亮

· 备注:与GUMI形成声音对比

乐正龙牙

· 推荐音域:C4-B4

· 擅长风格:沉稳、叙事

· 发声特点:沉稳、温厚、偏男性

· 备注:男声中文声库

徵羽摩柯

· 推荐音域:C4-B4

· 擅长风格:电子、流行

· 发声特点:少年音,明亮

· 备注:14岁天才少年设定

墨清弦

· 推荐音域:D4-C5

· 擅长风格:抒情、流行

· 发声特点:低沉、温厚

· 备注:17岁高中少女设定

初音未来(VOCALOID版)

· 推荐音域:D4-E5

· 擅长风格:电子、快节奏

· 发声特点:电子感强,高音明亮,低音稍薄

· 备注:适合电子风格和快节奏段落

KAITO

· 推荐音域:C4-B4

· 擅长风格:民谣、流行

· 发声特点:清爽、温和

· 备注:日语男声

MEIKO

· 推荐音域:D4-C5

· 擅长风格:摇滚、演歌

· 发声特点:浑厚有力

· 备注:初代御姐声线

三、OpenUTAU声库(UTAU声库)

蔚律

· 推荐音域:D4-C5

· 擅长风格:流行、抒情

· 发声特点:绿发金瞳海龟形象,宝安中学VOCALOID社自制声库

· 备注:UTAU引擎,测试版v0.1

UTAU声库通用注意事项:

· UTAU声库没有统一的音域标准,取决于声源提供者的声音条件和采样质量

· 在OpenUTAU中通过flags调整音色,响应特性取决于重采样器

· 使用前建议先测试音域和flags响应

四、音域选择的通用建议

1. 主旋律尽量落在声库舒适音域内,避免长时间处于极限音区

2. 副歌可以向上扩展1-2个音,但要控制在声库能稳定发声的范围内

3. 戏腔段落需要整体高八度或五度,确保原旋律在声库的舒适音域内

4. 快节奏段落可以适当降低音区,保证咬字清晰度

5. 低音区会降低发音清晰度,快速段落中慎用

附录H:OpenUTAU flags常用组合速查表

本附录列出OpenUTAU中常用flags组合及其对应的风格效果。flags通过字符串形式输入,例如g-4t+10h+20表示降低性别值、增加张力、增加呼吸度。不同重采样器对同一flags的响应可能不同,建议在使用的重采样器上测试效果。

一、flags基础对照

flag 名称 负值效果 正值效果 常用范围

g 性别/共振峰 更低沉/更男性化 更明亮/更女性化 -10 到 +10

t 张力 更松弛、更软 更紧、更有力 -15 到 +15

h 呼吸度 更干净、更纯声 更多气息、更气声 -20 到 +30

E 清晰度 更模糊、更柔和 更清晰、更锐利 -5 到 +10

b 明亮度 更暗、更柔和 更亮、更清脆 -10 到 +10

BRE 呼吸(专用) 同h,但仅对特定重采样器生效 同h,但仅对特定重采样器生效 -20 到 +20

二、按风格的flags组合参考

摇滚风格:

· flags组合:g+5t+10E+5

· 效果:声音明亮有力、具有穿透力

· 适用段落:副歌、摇滚风格的快节奏段落

· 重采样器建议:fresamp 或 TIPS

抒情风格:

· flags组合:g-2t-8h+15E-3

· 效果:声音柔和、温暖、有呼吸感

· 适用段落:主歌、抒情段落、句尾长音

· 重采样器建议:TIPS 或 moresampler

戏腔风格:

· flags组合:g-8t+12h-5E+8b+10

· 效果:声音细而有力、高亢、有穿透力

· 适用段落:戏腔段落的整体设置

· 注意:戏腔段落还需要升高八度并做元音替换(e→uo)

快节奏风格:

· flags组合:g+3t+5E+8b-5

· 效果:声音清晰、咬字干脆、节奏感强

· 适用段落:快节奏段落、说唱段落

· 重采样器建议:fresamp

电子风格:

· flags组合:g+5t+8E+6b+3

· 效果:声音干净、锐利、有电子感

· 适用段落:电子音乐风格的段落

· 重采样器建议:TIPS

耳语/气声风格:

· flags组合:g-5t-10h+25E-8

· 效果:声音极轻、气息感强、接近耳语

· 适用段落:人声内部天地对话的“低音耳语”段落

· 重采样器建议:TIPS 或 moresampler

句尾消散:

· flags组合:g-3t-5h+15

· 效果:声音逐渐变弱、有消散感

· 适用段落:句尾长音、歌曲结尾

· 注意:通常配合DYN逐渐降低

三、OpenUTAU flags调整的渐进顺序

如果你的flags组合效果不满意,按以下顺序进行微调:

1. 先调整g(性别)找音色方向:-10到+10范围内以2为步长移动

2. 再调整t(张力)找力度:-10到+10范围内以3为步长移动

3. 再调整h(呼吸度)找气息感:-10到+20范围内以5为步长移动

4. 最后调整E(清晰度)微调咬字:-5到+5范围内以2为步长移动

四、不同重采样器对flags的响应差异

重采样器 flags响应特点 推荐flags组合类型

fresamp 对g和t响应灵敏,音质干净 g±5t±10E±5

TIPS 对h和t响应灵敏,适合抒情 g±3t±8h+15

moresampler 对所有flags响应均衡,适合多种风格 全类型组合

bkh01 对g和b响应灵敏 g±8b±10

五、注意事项

1. 同一组flags在不同声库上的效果可能不同,建议在具体声库上做A/B对比测试

2. flags值过大可能导致声音失真或产生爆音,如发现异常应先减小flags值

3. flags组合只是调校的起点,精细调校仍需配合表达式(DYN、BRE等曲线)完成

4. 不同重采样器对flags的响应方式不同,更换重采样器后需重新测试flags组合效果

附录I:调教干声交接规范

调教完成后,需要将虚拟歌手的干声(Dry Vocal)导出发送给混音师或下一环节的制作人。本附录说明干声导出的格式规范、命名规则和附带信息要求。

一、干声导出格式要求

· 文件格式:WAV(PCM编码,无压缩)

· 采样率:48kHz 或 44.1kHz(与工程一致)

· 位深:24bit

· 声道:单声道(Mono),除非有特殊立体声效果要求

· 导出范围:从工程开头到最后一个音符结束,包含必要的空白前导和尾音衰减

二、文件命名规范

格式:歌曲名_声库名_版本号_日期.wav

示例:

染暮行_GUMI_v2.1_20260815.wav

蚂蚁_洛天依_v1.0_20260822.wav

术_GUMI_调教v3_20260830.wav

说明:

· 歌曲名:使用中文或拼音(与工程名一致)

· 声库名:标注使用的具体声库(如GUMI、洛天依)

· 版本号:使用v数字格式,记录调校的版本

· 日期:YYYYMMDD格式,记录导出日期

三、附带信息(在干声文件名中无法包含的内容,可随邮件或文本一起发送)

调教者需要向混音师提供的附带信息包括:

· 歌曲BPM

· 歌曲调性(如C大调、D多利亚)

· 段落情绪标记(主歌/副歌/桥段对应的情绪标签,如“悲伤-低声”、“希望-爆发”)

· 特别处理说明(如戏腔段落的Tension设置、耳语段落的特殊处理)

· 如需混音师调整的内容(如“副歌人声希望更突出”)

附带信息格式示例(随邮件或文本发送):

歌曲名称:染暮行

声库版本:GUMI SV2

BPM:160

调性:D宫 → A徵 → G角 → B羽 → E商(五调式循环转调)

段落情绪标记:

· 起段(D宫):叙述、明亮

· 承段(A徵):温暖、推进

· 转段(G角):激昂、战斗

· 起复段(D宫):回归、喘息

· 再转段(B羽):忧郁、悲壮

· 合段(E商):苍茫、消散

特别处理:戏腔段落在“都化作一剑出”“青丝成雪”“一往无顾”三处有甩腔效果,Tension较高(85-92%)

混音建议:副歌人声希望推前2-3dB,主歌人声混响适度

四、版本管理

调校过程中如果需要导出多个版本,使用版本号区分:

v1.0:第一次完整调教

v1.1:微调PIT

v2.0:调整了副歌的DYN和BRI

v3.0:重新调校了戏腔段落

五、导出前检查

在导出干声前,确认已完成调教检查清单中的所有项目:

☐ 所有音符的歌词已正确填入,无遗漏

☐ PIT曲线已绘制(相邻音符之间已有滑音连接)

☐ 句首音头已做修饰(先降后升或先升后降)

☐ 句尾长音已有颤音(软件生成或手绘PIT)

☐ 句尾长音已做渐弱处理

☐ DYN已配置,主歌和副歌之间有明显的音量差异

☐ BRI已配置,不同段落之间有明显的亮暗对比

☐ BRE已配置,抒情段落的呼吸感足够

☐ 发音清晰,无明显的声调错误或吞字

☐ 从头到尾播放一遍,机械感已明显减少

☐ 工程文件已保存

☐ 干声已导出(WAV格式)

导出后建议在DAW中单独打开干声文件,从头到尾听一遍,确认没有导出错误(如文件截断、采样率错误、声道错误等)。如果混音师要求额外的参数说明或特定格式,以混音师的要求为准。

从0学会调教虚拟歌姬!
https://bzvclub.example.com/posts/tune-vocaloid/
作者
宝安中学VOCALOID社
发布于
2026-08-27
许可协议
CC BY-NC-SA 4.0
最后更新于 2026-08-27,距今已过 1 天

部分内容可能已过时

目录