Voice Cloning
了解 AI 语音克隆的工作原理,探索其在辅助沟通和旁白中的用途,并了解同意、深度伪造和安全风险。
语音克隆是指利用 AI 生成听起来像某个特定人物的新语音。系统不是重放录音,而是学习说话者声音中可辨识的特征,并生成他们可能从未说过的话语音频。这可以帮助人们用熟悉的声音交流,或以一致的方式为内容配音,但也意味着逼真的声音并不能证明说话者的身份。
语音克隆的工作原理#
语音克隆系统从目标说话者的录音开始。系统会分析音高、音色(即让两种声音即使音高相同也听起来不同的特质)和发音等特征。系统还会学习韵律的各个方面:让语音听起来自然的节奏、重音和语调。录音质量很重要。背景噪声、麦克风位置不一致,或样本只包含一种说话风格,都可能降低生成语音的可靠性。
系统会以可用于生成音频的形式表示这些说话者特征,这种形式通常称为说话者嵌入。它是对声音特征的紧凑数值描述,并非存储的句子列表。自定义语音工作流会将说话者录音与语音生成器结合起来:文本提供要说的内容,而学到的声音特征则影响说话的方式。有些工作流可以根据短样本进行适配,不过输出质量取决于样本和任务;即时自定义语音文档说明了合适的语音录音和同意许可为何重要。
生成器随后会生成音频波形,也就是扬声器或耳机播放的变化信号。要达到令人信服的效果,语音既要清晰易懂,也要具有可辨识度。同一个人在耳语、大笑或讲另一种语言时,声音可能会有所不同,因此,在一段短音频中匹配身份,并不能保证语音在所有情境下都自然。
语音克隆及相关术语#
当文字以学得的、可识别的声音说出来时,语音克隆就是一种特定形式的文本转语音。普通的文本转语音可以使用预设的合成语音,而不必模仿任何特定人物。语音克隆也可以将语音音频作为输入,并用另一种声音呈现其中的话语;其定义性特征是目标声音,而不是输入最初来自文本还是语音。
语音转文本的方向相反,会将口语转换为文字稿。改变录音的音高或速度则又有所不同:这些编辑会修改现有音频,而不是根据学得的声音身份生成新的话语。语音克隆属于生成式 AI,因为它会创建新的音频。
当合成媒体逼真地呈现某人说了其实际并未说过的话时,克隆声音就成了深度伪造。这两个术语不能互换使用:某人使用经过授权的自身声音克隆进行交流,并不一定是在试图欺骗他人。
两个真实世界的应用#
一种应用是辅助沟通。预期自己将失去说话能力的人,可以录下自己的声音,之后通过输入消息,让合成后的声音版本读出消息。Apple 的个人语音使用指南介绍了如何通过受支持的辅助功能进行沟通。在这种情况下,保留熟悉的声音可能与让话语清晰可闻同样重要。
另一种应用是经授权的旁白和配音。配音演员可以授权制作团队用一致的声音生成经批准的台词或译制旁白。这样可以减少每次修改都重新录音的需要,但发音、情感表达和语言变化仍需人工审核。Amazon Polly 的韵律指南中介绍的语速和音高控制可以调整表达方式,但不能取代使用他人声音所需的许可。
语音与视觉的结合#
语音克隆处理的是音频,而不是图像。不过,在多模态 AI应用中,它可以与独立的视觉组件协同工作。例如,创作者制作无障碍视频时,可以先分析影像以识别可见物体,撰写并审核描述,然后让经授权的克隆声音为其配音。Ultralytics YOLO26及其文档所述的预测模式可在视觉处理阶段处理图像或视频,但不能克隆声音,也不能验证说话者身份。明确区分这些职责,有助于开发者根据各组件的实际功能进行评估。
同意、真实性与安全#
一个人的声音与其身份密切相关,因此,在创建克隆声音前应取得明确许可,并商定其输出可以用于哪些场合。Microsoft 的语音人才同意指南提供了明确同意流程的示例。应将录音和生成的音频作为数据隐私的一部分加以保护,并在相关情境下告知听众语音是合成的。
网络犯罪分子可能会在电话中使用克隆声音,让来电听起来像是亲属或高管打来的,从而施压让对方汇款。FTC 关于虚假紧急情况诈骗的指南建议通过已知可靠的电话号码核实请求,而不是相信来电者的声音。对于已发布的音频,C2PA 的内容凭证说明介绍了一种记录媒体来源信息的方法。来源信息可以提供关于文件历史的有用背景,但其本身并不能证明其中每项口头陈述都属实。









