尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GPT-SoVITS 语音克隆指南:5 秒参考音频合成第一段声音

GPT-SoVITS 语音克隆指南:5 秒参考音频合成第一段声音 GPT-SoVITS 语音克隆指南5 秒参考音频合成第一段声音【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 用 5 秒人声就能零样本语音克隆——不训练直接推理出结果1 分钟素材微调后音色更稳。速度上官方在 4090 上测得 RTF 约 0.0141400 字、约 4 分钟的音频推理耗时 3.36 秒。先跑通装环境、启动、合成第一段声音clone 仓库建一个 Python 3.10 的 conda 环境一条安装脚本装完依赖和底模git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF # 无独显换 CPU国内网络可换 HF-Mirror 或 ModelScope--device按驱动选 CUDA 版本macOS 用 MPSWindows 整合包用户直接双击 go-webui.bat 跳过这一节。脚本会把底模和 G2PW 中文拼音模型放进对应目录不用手动搬。然后在项目根目录执行python webui.py浏览器打开 9874 端口进推理页签填参考音频对应的文本、上传音频、输入要说的文字点合成几秒后听到第一段用参考音色的语音。硬件没有写死的显卡型号门槛但 config.py 里显存低于 4GB 或架构太老的卡会自动回退 CPU能上独显尽量上。官方实测速度测试设备RTF越低越快RTX 40900.014RTX 4060 Ti0.028M4 芯片 CPU0.526素材分三档5 秒起步1 分钟定型10 分钟出成品三档是递进关系每一档没榨干再补下一档5 秒档零样本。能换到从会议录音里截 3~5 秒人声在推理页填好这段的文本、上传音频几秒后拿到同音色的新语音全程不训练。边界音色贴合度和稳定性完全受这 5 秒限制文本一长偶发漂移、像又不像。下一步同一人再找 1 分钟干净录音进微调。1 分钟档少样本微调。能换到跑一轮完整微调——0-数据集获取页用内置 UVR5 把人声抠出来、切片、ASR 自动识别并逐条校对1-文本处理页一键生成 hubert、说话人向量、语义特征再依次训练 GPTs1和 SoVITSs2回推理页换新模型合成漂移明显减少。边界这 1 分钟素材如果带噪或忽远忽近模型会连毛病一起学。下一步素材扩量同时开始精修数据。10 分钟档。能换到数据量上来后多轮训练输出接近专属音色适合长期做多集内容的场景。边界这个量级质量比数量重要一条噪声、一条错标都会把整体拉下来。下一步别再堆数据回去精修数据集。 效果不对先自查读错字、变调原因训练文本和音频对不上或语言标签标错。 处理把 ASR 标注和音频逐条对照改错后重训 s1比调任何参数都有效。合成带噪、有底噪原因喂进去的参考音频本身不干净。 处理先用内置 UVR5 分离出人声再合成或换安静环境重录别直接喂原音。训练中途显存爆掉原因没开半精度或切片过长一次塞太多帧。 处理把is_half设为true走 fp16还不够就把数据集获取里的切片时长调短。推理慢得离谱原因设备没走到 GPU回退到了 CPU对照上面速度表就有体感。 处理确认安装时--device选对、nvidia-smi能看到卡重装环境比调参数实在。 再进一步多语言底模已支持中/英/日/韩/粤训练集全用中文也行推理页把目标文本切成其他语言拿回的仍是这个音色不用另录目标语言的底稿。批量api.py 与 api_v2.py 提供 HTTP 接口默认端口 9880脚本循环调用即可批量合成一整套文案。手写训练列表不想点界面时列表格式为每行一条、竖线分隔音频路径|说话人|语言|文本./a.wav|我|zh|会议开始先同步进度想抠原理从这几个目录看起GPT_SoVITS/AR/ — GPT 侧自回归生成音素序列GPT_SoVITS/module/ — SoVITS 声学模型结构与 VQ 量化GPT_SoVITS/TTS_infer_pack/ — 推理主流程与多语言文本预处理GPT_SoVITS/prepare_datasets/ — ASR、特征提取、语义特征三步预处理docs/cn/README.md — 中文文档参数速查先从自己人声里截 5 秒跑一遍零样本听完再决定要不要补 1 分钟微调这是成本最低的路径。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表