
前言面向产品、风控、媒体与技术团队的入门和进阶读物更新日期2026 年 7 月 29 日。文中产品能力以公开资料为准模型、价格、许可和可用区域变化很快落地前应再次核验。一段听起来像真人的语音不再天然等于“真人亲口说过”。今天的合成系统已经可以根据一段文本生成富有停顿、情绪和口音的旁白也可以从一小段授权参考音频中提取音色在另一种语言中说出此前从未说过的话还可以把某人的真实讲话转换成另一位说话人的声音。与此同时最朴素的“外放后再录”翻录、重放仍然是电话身份认证和取证场景中最常见、最容易被忽略的攻击方式。这篇文章把“语音伪造”拆成可操作的类别介绍当前常见生成技术与模型说明它们的正当用途和风险并给出一套可落地的鉴别与处置框架。核心结论很简单音频鉴定不是只回答“像不像 AI”而是同时回答它是如何产生、是否被改动、来自哪里以及它能否支持某项高风险决策。1. 先建立共同语言什么是“语音伪造”“深度伪造语音”audio deepfake是总称指借助算法生成、转换、拼接或重放使音频内容、说话人身份、语境或来源产生误导的语音。它并不等同于“只要音频经过处理就是伪造”降噪、压缩、剪辑、配音和无障碍朗读可能完全正当关键在于是否对内容、身份、来源或授权关系作出错误表达。从攻击面看语音材料可被伪造或改变的对象有四个被改变的对象典型问题例子说了什么内容这句话是否真的说过用 TTS 合成“请立即转账”的指令谁在说身份这是不是该说话人克隆高管/亲属的音色如何说风格与情绪语速、口音、情绪是否被操控把平静讲话变成愤怒威胁从哪里来来源与链路文件或通话是否来自声称的设备/账户真实录音经扬声器播放后重新采集1.1 主要类型及区别类型输入输出改变的核心与其他类型的区别文本转语音TTS文本 预置或授权声音新语音内容可指定声音/风格不一定模仿真人可能只是系统预置音色语音克隆voice cloning文本 目标人的参考语音用目标人音色说新内容身份 内容是 TTS 的“定制身份”形态生成的话可从未由本人说过语音转换VC / 变声源说话人的现成语音 目标音色保留原话内容的另一种声音主要是身份也可能改风格不先输入文本通常保留源语音的时长、节奏和情绪语音到语音翻译/配音源语音 目标语言或脚本另一语言的语音内容语言可能连带身份可使用原声或克隆音色重点是跨语言表达拼接、重配、局部编辑多段真实或合成素材修改后的录音内容或语境不必依赖深度学习剪掉否定词就可能改变语义翻录 / 重放replay一段已有录音 扬声器/播放设备二次采集的录音或实时通话声来源与采集链路原始语音可能百分之百真实但不是此刻真人在场混合型伪造上述任意组合更逼真的结果多项同时改变例如克隆音色 电话编码 背景噪声 外放重录一个容易混淆的点是“翻录”它通常不是“把文件复制一份”而是把已有语音从手机或扬声器播放再用另一台设备或通话链路采集。该过程会留下扬声器、房间混响、麦克风和编码的痕迹但高质量设备与复杂链路会使检测变难。ASVspoof 2021 将攻击明确分为经电话/VoIP 传输的 TTS 与 VC逻辑接入LA、真实空间中的设备重放物理接入PA以及不绑定声纹认证的语音深伪检测DF这种划分很适合工程测试集设计。ASVspoof 2021 评测计划1.2 “合成”“克隆”“变声”“翻录”一句话辨析TTS让系统“把文字念出来”。声音可以是虚构的预置音色。克隆让系统“用某个人的声音念出新文字”。它关注目标人的音色、韵律和口音。VC让系统“把甲已经说出的那句话听起来像乙在说”。它以一段语音为起点而不是以文字为起点。翻录不是合成而是“把已有声音拿来冒充此时此刻的真人”。因此单一的合成检测器不应承担全部翻录检测任务。2. 它们如何工作从传统 TTS 到语音大模型2.1 经典流水线仍然重要传统神经 TTS 大致可拆为文本 → 文本规范化 / 分词 / G2P字词转音素 → 声学模型时长、音高、能量、频谱、韵律 → 声码器vocoder→ 波形文件其中文本规范化负责将“128.50”“2026-07-29”等文字读对G2Pgrapheme-to-phoneme负责发音声学模型决定节奏、重音和语气声码器把抽象声学特征还原成可听见的波形。微软对 Custom Voice 的公开说明也将链路概括为文本分析器、神经声学模型和神经声码器三部分并指出音色、语速、语调和重音等特征在中间层形成。Azure Custom Voice 概览早期的拼接式 TTS 依赖大量录音单元统计参数语音合成依赖显式概率模型它们可控、成本低但机械感较强。端到端神经 TTSTacotron、FastSpeech、VITS、HiFi-GAN、StyleTTS 等路线显著改善了自然度。如今的前沿系统又进一步把音频压缩为离散或连续的codec token音频码元再用 Transformer/LLM 预测这些 token。微软的 VALL-E 将 TTS 表述为条件语言建模任务而不是直接回归连续波形这是“语音大模型”路线的代表性思想。VALL-E 项目说明2.2 现代系统为何更像真人现代语音系统通常组合下列能力大规模预训练从多语言、多说话人、多场景语料学习发音、韵律和风格先验。说话人表征用参考音频提取 speaker embedding 或提示 token控制“像谁说”。零样本zero-shot提示无需为每个人重新训练给一段干净参考音频即可迁移音色速度快但极特殊嗓音或噪声样本可能失真。微调/专业克隆用更多、标注更好的授权录音训练专属模型身份一致性和稳定性更高但训练与审核成本也更高。指令与风格控制用自然语言或标签指定“新闻播报、耳语、急促、粤语口音、开心”等控制颗粒度正在从整段走向词级。流式双向生成文本可边输入、音频可边输出适配实时助手、游戏 NPC 和电话机器人。以 ElevenLabs 为例其文档把克隆分为 Instant Voice Cloning即时克隆和 Professional Voice Cloning专业克隆前者使用模型既有知识快速推断不会为该人单独训练模型后者使用更多数据训练专属模型通常需要数小时。克隆方式说明 这正对应“零样本提示”和“专属微调”的工程权衡。2.3 VC 与翻录的技术路径VC变声先从源音频中分离语言内容、音高、节奏和说话人信息再以目标说话人特征重新解码。实时变声常要处理低延迟、音高提取和音色泄漏。开源 RVC 项目将其定位为基于 VITS 的变声框架并公开了实时界面与训练流程其社区项目页声称少于 10 分钟音频即可训练出可用 VC 模型这解释了它在直播和二创中的传播力。RVC 项目重放攻击者不需要理解或生成语音只需拿到一段可通过验证的录音。因为声音会经历“播放器 → 空气/线路 → 接收麦克风 → 编码器”检测重点是设备频响、混响、非线性失真、静音段噪声和双重压缩痕迹而不是 TTS 声码器痕迹。3. 当前常见的生成产品与模型该如何看它们下面的清单不是性能排行榜也不表示任何工具可用于未经同意的模仿。它的用途是帮助读者理解市场中的技术分层云服务重视稳定、审核和部署开源模型重视可私有化、可复现和可定制研究模型常引领后续产品形态。类别 / 产品或模型典型能力技术或产品特征适合的正当场景与注意事项OpenAIgpt-4o-mini-tts文本生成自然语音面向 API 的 TTS 模型可通过audio/speech使用最长输入 2,000 token对话式产品、无障碍朗读、内容配音界面应清楚告知用户听到的是 AI 语音。模型页Google Gemini Flash TTS提示词驱动的多语言、高表现力朗读可用自然语言提示控制风格、语气、节奏支持多语言、预置声音及 SynthID 水印多语言语音代理、教育内容、品牌旁白关注预览版稳定性与区域服务条件。发布说明Microsoft Azure Neural TTS / Custom Voice标准神经音色与专属声音可上传语音和脚本训练再通过 API、SDK、SSML 调整语速、音高、风格专属声音受资格和用途限制企业客服、品牌角色、辅助技术应保留授权、用途与撤销记录。官方文档ElevenLabs IVC / PVC快速克隆或高保真专属克隆IVC 快PVC 以更大数据集训练专属模型即时克隆宜使用清晰、无混响样本有明确授权的配音替补、创作者声音资产“能上传”不等于“有权克隆”。最佳实践CosyVoice 3开源多语种/方言、零样本及跨语种克隆、指令控制LLM 路线支持多语言、中文方言/口音、双向流式与低延迟中文场景、私有部署、实时交互研究须核对模型许可、训练数据和商用条款。项目主页Fish Speech S2开源/研究情感丰富的 TTS、快速克隆、多说话人双自回归架构覆盖多语言、短参考音频快速克隆及词级控制角色演绎、研究和多语言内容不要把项目自述效果当成独立第三方基准。发布页IndexTTS2开源可控零样本 TTS着重发音、情感和时长控制中文配音、可控叙事、离线生产需检视模型许可和运行硬件要求。项目页ChatTTS开源面向日常对话的中英 TTS重视笑声、停顿、语气词等对话韵律公开模型限定学术研究用途本地原型、研究型 LLM 助手不要把非商用模型直接放入商业生产。项目页MeloTTS / Kokoro 等轻量模型较低资源的多语种或单语种 TTS重视部署成本与启动速度MeloTTS 支持多语言与 CPU 实时推理边缘端、离线朗读、资源受限设备先按语言、许可证、时延和音质测试选择。MeloTTSVALL-E 等 codec-LM 研究路线少样本声音提示、生成式高保真语音将音频离散码元化后进行语言模型式生成影响了“音频 token 大模型”的产品设计研究、理解技术趋势不等于可直接商用的产品。选择模型时不要只听一段 demo。至少要在自己的文本、目标语言、目标麦克风/编码链路和延迟预算下评估维度要问的问题自然度与可懂度专有名词、数字、日期和中英混读是否正确嘈杂环境下是否仍能听清身份相似度是“像一个人”还是能稳定像目标授权声源跨语言后是否漂移韵律控制能否可靠控制停顿、重音、情绪、语速和角色切换实时性首包延迟、实时率RTF、并发、断网降级如何数据与许可参考音频是否有可验证同意模型、权重、输出各自的商用条款是什么安全与可追溯性是否有声源验证、水印、生成日志、删除/撤销机制和滥用申诉渠道4. 语音伪造可以做什么价值与风险总是并存4.1 合规且有价值的应用无障碍与辅助沟通为视障用户朗读内容帮助因疾病失声的人以自己预先授权的声音继续表达。本地化与教育把课程、产品说明、博物馆导览快速转为多语言/方言语速和发音可按学习者调整。有声内容和游戏有声书、播客、影视临时配音、游戏角色和虚拟主播可显著降低长尾内容的制作门槛。客户服务与语音代理用稳定的品牌声音承接低风险、可审计的问答和通知人类坐席处理敏感、高价值和复杂问题。授权的声音资产管理为演员、配音员建立可授权、可计量、可撤销的声音数字资产减少重复录制。创作与研究情绪表达、跨语种配音、语音修复与历史资料辅助复原。这些场景的共同底线是使用者知道自己在与合成声音交互声源本人已经明确同意生成内容、使用范围、期限和报酬可以追溯。4.2 主要风险风险常见方式为什么危险对策重点资金诈骗 / 社工冒充高管、亲属、客服要求转账或给验证码声音能绕过“熟人直觉”时间压力会压缩核验流程回拨已知号码、双人复核、交易外通道确认生物特征与账户接管用克隆声尝试语音口令、客服验证声纹不是秘密公开演讲和短视频可成为样本不把声纹当唯一因子采用活体挑战与多因素认证舆论与选举操纵假冒政治人物、媒体人发言音频易转发且上下文常被剥离来源证明、平台标注、快速辟谣与媒体素养名誉与隐私侵害伪造辱骂、亲密内容或虚假承诺伤害扩散快受害人举证成本高证据保全、权利投诉、去除与法律救济流程企业流程欺诈假会议、假语音审批、假供应商来电攻击者往往叠加钓鱼邮件、视频与聊天工具支付流程不依赖语音强制复核和设备/域名验证内容污染把合成音频混入训练、新闻或取证语料降低数据可信度影响后续模型与决策维护来源清单、哈希、采集日志和标注策略4.3 两个值得记住的真实案例案例一伪造高管视频会议导致转账。香港政府在 2024 年披露一名员工收到冒充英国总部 CFO 的钓鱼邮件后进入群组视频会议警方认为诈骗者利用网上公开视频和被冒充人员的声音制作预录会议受害人随后向五个本地账户授权转账损失约 2 亿港元。该案的关键不是单纯“声音很像”而是邮件、会议画面、权威职位和后续即时通讯共同构成了可信假象预录会议无法进行真正的临场互动也是重要破绽。香港政府答复LCQ9案例二仿冒政治人物的 AI 语音电话。2024 年美国新罕布什尔州初选前选民收到了听起来像拜登总统的自动电话内容劝其不要参加初选。FCC 的执法文件认定该流量包含人工生成、模仿拜登声音的 deepfake 预录消息相关执法随后提出 600 万美元罚款。该案例说明即使没有要求汇款伪造语音仍可通过改变行为和信息环境产生现实伤害。FCC 执法公告监管与治理也不应被误解为“检测器一装就解决”。美国 FTC 在其语音克隆治理讨论中把干预分为上游预防/认证、实时检测/监测、事后内容评估三层并明确指出不存在单一解决方案水印也可能在重编码、裁剪或故意攻击后失效。FTC应对 AI 语音克隆5. 如何鉴别伪造语音不要只靠“耳朵听”或“一个分数”5.1 人工初筛有用但不能作为定论以下现象值得标记为“需要复核”而非直接判定为假长句的呼吸、停顿、断句与语义不协调情绪突然跳变。人名、数字、缩写、日期或中英混读发音异常尾音、齿擦音、爆破音不自然。音色过于恒定或句与句之间的共振峰、距离感、背景声不连续。电话中对随机问题反应异常慢反复回避、答非所问或无法完成即时挑战。自称高管/亲属却要求打破既有流程如“立刻转账”“不要回拨”“保密”。为什么不能靠耳朵因为高质量模型会逐渐消除这些瑕疵反过来真人语音经过低码率、丢包、降噪、远距离录制后也会听起来“像合成”。人工听辨适合发现异常与设计核验问题不适合作为唯一证据。5.2 机器检测的四条技术路线路线检查什么常见特征/模型优点局限声学伪迹检测波形、频谱、相位和声码器残留CQCC/LFCC、梅尔谱、相位/周期性特征、RawNet、AASIST、Wav2Vec2/XLS-R 分类器对已见过或相近生成器有效可批量处理容易受新模型、压缩、噪声、语种和录音链路的域偏移影响重放/链路检测扬声器、房间、麦克风和二次编码痕迹频响、混响、调制谱、静音噪声、双重压缩、设备指纹专门覆盖“原声真实但不是现场”的攻击高品质设备、数字直连和复杂环境会降低可分性说话人核验 活体挑战是不是目标人、是不是现在实时说话声纹验证ASV、随机口令、动态短语、交互时延、设备/账户认证可直接服务认证业务不只问“AI 否”声纹不能单独承担高风险认证挑战题若可预测会被录制或实时生成绕过来源与水印验证是否有可信生成声明、编辑历史与签名生成平台水印、C2PA Content Credentials、文件哈希、签名、采集日志可回答“从何而来”取证价值高无水印不代表真实元数据可丢失水印可能被攻击或不兼容在基准评测中ASVspoof 提供了含真人和多种伪造语音的 LA、PA、DF 数据库以及 EER、min t-DCF 等评测工具。它很适合作为起点但不能替代对电话编码、中文方言、短语音、多人对话、真实重放设备和最新生成模型的本地验证。ASVspoof 2021 数据与基线5.3 声学检测到底在看什么可将一段音频分帧后检测器会学习或计算以下线索频谱与共振结构语音的谐波、共振峰、能量过渡是否呈现不自然的平滑、断裂或高频缺失。相位、周期性与激励细节人声声带振动并非完全规则生成器、降噪器或声码器可能改变细粒度相位与非周期成分。时间连续性音素交界、呼吸、停顿、情绪和音色是否在帧之间合理衔接。生成器指纹特定 codec、上采样器、量化器或后处理会在频带、瞬态和噪声底留下统计规律。环境与设备一致性真实的同一录制环境在说话段与静音段、不同句子间通常有稳定模式翻录常引入额外的扬声器/房间/麦克风层。语义—韵律一致性把 ASR 文本、说话人嵌入和声学表征联合起来检查语义、情绪、口型有视频时与声学是否互相支持。现代分类器可直接在原始波形或自监督语音表征上学习这些模式减少手工特征依赖但它们学习到的也可能是数据集捷径例如某种压缩格式或录音环境。因此检测结果最好输出时间段级风险、模型版本、阈值、输入预处理和不确定性不要只给一个“真/假”标签。5.4 主动防护水印、来源证明与签名被动检测试图从任何来历不明的音频中寻找伪迹主动防护则在生成或采集时留下可验证信号。音频水印在尽量不影响听感的前提下嵌入机器可读标记。Meta 的 AudioSeal 使用局部化水印生成器嵌入不可感知标记检测器可在长音频或被编辑片段中定位标记项目资料声称其对压缩、重编码和加噪保持一定鲁棒性。AudioSeal 官方实现内容来源证明provenanceC2PA Content Credentials 通过带签名、可验证的声明记录资产的来源、修改和制作链路适用于包括音频在内的数字资产。C2PA 说明安全采集与签名在录音设备或通话端给原始音频、时间、设备/账户标识和传输链路签名将原始文件哈希、采集人员、保管过程写入审计记录。三条必须写在产品提示里的边界检出水印只能强力支持“某兼容系统曾生成/处理过它”不自动推出“整段内容均为伪造”或“某人有恶意”。没有水印或凭证不能证明是真实可能来自未部署这些机制的系统或元数据在平台转码中丢失。任何单点机制都能被规避或误伤。最稳健的策略是水印/来源证明、被动检测、交互认证和业务流程控制相互补位。6. 面向不同场景的处置流程6.1 普通用户遇到“熟人紧急求助电话”怎么办听到紧急要求 → 不在当前通话中转账、给验证码或泄露隐私 → 挂断后用通讯录中已保存的号码主动回拨 → 通过另一条已知渠道家人群、线下、视频交叉确认 → 仍有疑问保留录音、号码、聊天记录和转账信息及时向平台/警方/银行报告不要把“问一个只有家人知道的问题”当作万能方案公开社交内容、旧聊天记录可能泄露答案。更稳妥的是事先约定独立验证方式例如家庭紧急口令结合回拨且口令不要在同一通话中被对方重新设置。6.2 企业把声音从审批凭据中降级高风险操作应遵循“语音可触发提醒不可单独授权付款”的原则任何付款、改收款账户、导出敏感数据等操作都必须在受控系统内完成不以电话、语音留言或即时通讯语音作为唯一指令。采用双人复核、额度分级和已登记联系人回拨回拨号码来自企业目录而不是来电方提供的号码。视频会议中的“领导本人”也不是充分身份凭据。对异常指令要求实时随机互动、书面工单和系统内二次确认。给财务、客服和高管助理进行情景演练训练重点是识别流程异常而不是要求员工听出所有 AI 声音。对语音样本、检测分数、关联邮件、通话元数据和处置过程做可审计留存高风险结论应由复核人作出。6.3 产品与检测团队推荐的多层架构上传/通话音频 ├─ 格式与完整性采样率、编码、时长、文件哈希、元数据 ├─ 信号质量门控静音、SNR、削波、多人重叠、可检测性评估 ├─ 多路模型TTS/VC 伪迹 翻录检测 说话人/活体若有注册声纹 ├─ 主动证据水印、C2PA、可信采集签名 ├─ 融合与校准按场景、语言、链路输出风险区间和可解释片段 └─ 决策编排低风险放行中风险二次核验高风险人工复核/冻结交易工程上尤其要避免四个误区误区一把模型概率当作真实世界概率。0.95往往只是该模型在某训练分布下的分类置信必须通过目标业务数据校准阈值。误区二只用一个公开数据集。训练集/测试集与真实通话的编码、语言、设备和攻击者工具不同性能可能大幅下降。误区三把“翻录”和“合成”混为一个标签。两者需要不同的证据和模型处置价值也不同。误区四只保存最终分数。至少保存模型版本、预处理、窗口级分数、阈值、输入哈希和人工复核意见才能复现与申诉。6.4 如何评估检测系统是否真的可用除总体准确率外建议按业务风险查看指标/测试关注点EER、ROC/DET、PR 曲线模型区分能力类别极不均衡时尤需 PR 曲线FAR / FRR把真人误报为假、把伪造漏报的代价是否可接受分段定位准确度是否能找出拼接或局部合成的时间位置校准误差0.8 风险是否真的接近 80% 的经验发生率跨域压力测试电话/VoIP 编码、压缩、加噪、混响、远场、重采样、剪辑、变速跨语言/人群测试普通话、方言、英语混读、不同年龄与嗓音条件下是否公平未知攻击测试未在训练中见过的新 TTS、VC、codec 和后处理工具端到端业务演练从来电到转账拦截人工与系统是否能在时限内协同7. 合法、伦理与沟通技术能力不等于使用授权声音既是人格特征也可能是可被用于认证的生物特征。建设或使用生成语音系统时建议至少做到获得明确、可撤回、可审计的同意说明采集哪些音频、生成什么内容、在哪些渠道使用、是否用于训练、保存多久、谁可访问。限制目的和范围把“为一支广告配音”的授权与“永久训练通用克隆模型”的授权分开不要把一次录音同意扩大解释为无限使用。清晰披露合成属性机器人客服、虚拟角色和合成旁白应以用户能理解的方式说明。披露既是尊重也降低信任被透支的风险。设计撤销、删除和申诉流程声源本人应能查看、停用、删除其声音资产并对滥用内容快速投诉。默认安全的产品设计对高风险克隆设置身份核验、同意校验、滥用监测、速率限制和人工复核不要把敏感声音的批量导出与匿名使用做成默认能力。让业务流程抵抗伪造真正的防线不应依赖“人耳永远能听出假声音”而应让单一通话无法越过高价值授权门槛。微软的 Custom Voice 公开文档正是一个可参考的产品治理例子其专属声音访问受资格和用途条件限制专业音色微调要求提交声源本人同意声明。Microsoft Responsible AI 说明8. 结语从“鉴假”走向“可验证的信任”语音生成技术会继续进步单靠寻找某种固定的“AI 味”注定越来越脆弱。更可靠的路线是分层用授权、身份核验和流程控制减少伪造能够造成的伤害用水印、签名和来源证明提高合规生成内容的可追溯性用多模型声学检测与翻录检测筛查未知来源材料用人工复核、交叉验证和证据链处理高风险结论。对于个人最重要的是在紧急语音指令面前暂停并换渠道验证对于企业最重要的是不让任何一段声音单独成为付款或敏感操作的凭据对于开发者最重要的是把“检测分数”设计成可解释、可复核、可申诉的风险信号而不是绝对真相。延伸阅读与资料来源ASVspoof 2021语音反欺骗数据、基线与评测FTC应对 AI 驱动语音克隆的方案与局限C2PA Content Credentials 说明AudioSeal局部化音频水印官方实现Azure Custom Voice 官方文档ElevenLabs Voice Cloning 文档CosyVoice 开源项目香港政府披露的 deepfake 欺诈案例