尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何用 1 分钟音频做语音克隆:GPT-SoVITS 实操手册

如何用 1 分钟音频做语音克隆:GPT-SoVITS 实操手册 如何用 1 分钟音频做语音克隆GPT-SoVITS 实操手册【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS想让自己的声音、或者朋友的声音念出任何一段文字吗GPT-SoVITS 是一个开源的少样本语音克隆工具给它 5 秒人声就能零样本合出该音色的文本语音再给 1 分钟音频做微调相似度还会明显提升。它带图形界面覆盖中文、英语、日语、韩语、粤语从录音到出声基本在浏览器里就能完成。它适合解决什么问题常见的 TTS 引擎需要你训练模型、准备大量数据门槛高。GPT-SoVITS 把这件事拆成了两档零样本上传一段 5 秒参考音频 对应文字直接合成适合先试试效果。少样本微调准备 1 分钟左右的干净人声走一遍内置的切片 → 去噪 → 语音识别 → 校对 → 训练流程得到一个专属音色模型适合做长期项目有声书、角色配音、多语言课件。另外它支持跨语言推理——用中文素材训练也能合出日语、英语等语言目前支持zh/en/ja/ko/yue对做双语内容的人比较实用。最快跑起来的路径Windows 用户可以直接下载官方整合包双击启动脚本即可其他系统用下面几步git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 conda activate GPTSoVits bash install.sh --device CU128 --source HF--device按你的硬件选CU126/CU128/ROCM/CPUMac 选MPS或CPU--source指定模型下载源国内网络可换HF-Mirror或ModelScope。脚本会装好依赖并把预训练模型放到 GPT_SoVITS/pretrained_models 等对应目录中文合成还需要 G2PW 模型安装脚本会处理放到GPT_SoVITS/text。装完启动界面python webui.py浏览器会打开 WebUI主要页面是0-前置数据集获取工具和1-GPT-SoVITS-TTS内含 1A 训练集格式化、1B 微调训练、1C 推理三个标签页还有 UVR5 人声分离入口都在页面里点选操作。从录音到出声完整流程第一步备料。准备一段 1 分钟左右的人声安静环境、无背景音乐语速语调自然一点。内容尽量多样不同情绪、长短句效果会好一截。第二步走流水线。在0-前置数据集获取工具里填音频路径 → 自动切片 → 可选去噪 → ASR 自动识别 → 校对文本。如果原始音频带背景音乐先用 UVR5 分离出纯人声。校对这一步别省标注文本的错误会直接进模型。最终会生成一个.list标注文件格式是音频路径|说话人名|语言|文本内容 # 例D:\data\a1.wav|xxx|zh|今天天气不错第三步训练 合成。切到1B-微调训练按提示跑完GPT 部分和 SoVITS 部分会依次训练然后到1C-推理选刚训好的模型填参考音频和待合成文本点按钮出声。训练产物按版本存进GPT_weights_v3、SoVITS_weights_v3这类目录推理时直接下拉选择即可。版本怎么选、怎么让效果更好项目有 v1/v2/v2Pro 和 v3/v4 两条线特性差别挺大版本线特点建议v1 / v2 / v2Pro对素材质量更宽容速度较快v2Pro 音质更高素材一般、想先跑通v3 / v4音色相似度更高、情感更丰富v4 原生 48kHz 音质更通透素材干净、追求上限官方说明里也提到训练集音质一般时v1/v2/v2Pro 往往比 v3/v4 稳v3/v4 的语调会更贴参考音频。所以别一上来就追最新版先看手里的录音质量。影响效果的两个实操要点一是参考音频推理时上传的那段尽量干净且和训练素材同一个人、同一种录音环境二是文本标注宁慢勿错。推理速度方面官方数据约 RTX 4090 上 RTF 0.014约 3 秒出 4 分钟音频M4 CPU 上约 0.526GPU 下日常使用完全够用。往深处走API 化部署不想用界面时跑python api_v2.py -p 9880向/tts发 POST 请求即可拿音频流参数采样温度、语速、流式输出等文档直接写在 api_v2.py 文件头部很适合接进自己的应用。Docker 运行仓库提供了 docker-compose.yaml 和 docker_build.sh有完整版和不含 ASR/UVR5 模型的 Lite 版可选。读代码文本前端在 GPT_SoVITS/text/GPT 语言模型在 GPT_SoVITS/AR/models/声学模型在 GPT_SoVITS/module/ASR 工具在 tools/asr/。文档中文说明 和 更新日志 在各语言目录下都有。一个具体建议第一次上手别直接微调先用零样本模式拿 5 秒录音试试效果——如果相似度已经够用你可能根本不需要走训练流程只有当你明确要长期使用这个音色时再投入时间准备 1 分钟素材去微调。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表