
Mac 上 3 步跑通 GPT-SoVITS1 分钟语音数据做零样本声音克隆【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一个开源的少样本声音克隆 TTS 工具1 分钟语音样本就能训练出专属音色模型。这篇教程覆盖 macOS 上 3 步装好并启动推理 WebUI 的完整流程M4 CPU 上 v2ProPlus 的 RTF 为 0.526。先看效果——完成后你能得到什么全部完成后你会得到一个本地可访问的 GPT-SoVITS-WebUI5 秒参考音频即可零样本合成1 分钟数据还能微调出专属音色模型。项目效果零样本 TTS5 秒参考音频直接合成不需要训练少样本微调1 分钟训练数据音色相似度更高推理速度官方实测v2ProPlus RTF4090 为 0.0144060Ti 为 0.028M4 CPU 为 0.526入口WebUI 开在 127.0.0.1:9874支持中、英、日、韩、粤 5 种语言推理界面在 1C-inference 标签页上传参考音频、输入文本就能得到音频文件。数据集准备也在 WebUI 里内置人声分离、自动切片、ASR 转写和文本校对工具。表中数字全部来自项目 README 的官方测试。3 步跑通总共 3 段命令每步都带验证点对得上就继续下一步。第 1 步拿到代码和 Python 环境git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS cd GPT-SoVITS conda create -n GPTSoVits python3.10 -y conda activate GPTSoVits验证点终端提示符前缀变成(GPTSoVits)。官方安装命令推荐 python3.10Apple Silicon 在 Python 3.9 / 3.11 加 PyTorch 2.5.1 / 2.7.0 下都经过测试。第 2 步一条命令装依赖和预训练模型brew install ffmpeg bash install.sh --device MPS --source HF脚本一次装完CPU 优化的 PyTorch 环境、全部底模下载到GPT_SoVITS/pretrained_models/、中文前端的 G2PW 模型。国内网络可以把--source HF换成--source ModelScope。注意 macOS 上--device MPS实际安装的是官方 CPU 优化推理路径这是项目的设计原因见下一节。验证点脚本跑完没有红色Error输出GPT_SoVITS/pretrained_models/目录里能看到s2G2333k.pth、s1v3.ckpt等模型文件。第 3 步启动 WebUIpython webui.py验证点终端打印出包含127.0.0.1:9874的地址浏览器打开后能看到 GPT-SoVITS-WebUI 页面。命令后可选加语言参数例如python webui.py zh。进入 1C-inference 标签页上传一段 5 秒参考音频输入一句话合成后能直接试听、下载音频。它为什么能更快在 Apple Silicon 上官方实测最快的推理路径不是 GPU而是 CPU 优化链路。GPT-SoVITS 由 GPT 和 SoVITS 两个模型串联GPT 把文字转成语义 tokenSoVITS 再把 token 变成波形。这像餐厅的两道工序前菜间GPT定配方灶台SoVITS负责出菜。2024 年 2 月项目实测 Mac 上 MPS 路径比 CPU 更慢于是把推理设备改为 CPUinstall.sh 里的--device MPS装的就是这套 CPU 优化环境。Apple Silicon 的 CPU 单核性能足够高官方实测 v2ProPlus 在 4060Ti 上 RTF 0.0281400 字约 4 分钟音频推理 3.36 秒M4 CPU 上 0.526都属于可用水平。踩坑速查遇到报错先对照这张表多数是环境问题不是代码问题。现象原因一句话解法出现 install.sh 开头卡住不动Xcode 命令行工具没装先xcode-select --install再重跑脚本会自动等待出现 ffmpeg 缺失、音频切片报错macOS 不自带 ffmpegbrew install ffmpeg即可出现端口 9874 页面打不开旧 WebUI 进程还占着端口lsof -i:9874找到 PID 杀掉再启动出现中文合成读错字、音素异常G2PW 中文前端模型缺失重跑安装脚本或把 G2PWModel.zip 放到GPT_SoVITS/text/出现 tts_infer.yaml 里 is_half 改 true 后报错Mac 的 CPU 路径不支持 fp16 半精度改回默认is_half: false不要动这一项需要更深的时候基础推理跑通后项目里有 3 条现成路径可以直接扩展。少样本微调用 1 分钟数据训练专属音色GPT 侧对应GPT_SoVITS/s1_train.pySoVITS 侧对应GPT_SoVITS/s2_train.pyWebUI 里有完整按钮不用手写命令。API 服务把合成能力以 HTTP 接口暴露给你自己的应用启动api_v2.py默认端口 9880不经过 WebUI。流式推理v2Pro 流式输出首句出声的等待感更短实现看GPT_SoVITS/stream_v2pro.py。更多细节可以翻 中文文档 和 更新日志。建议你先按 3 步装完在 1C-inference 标签页合成一条 5 秒零样本样音确认音色可用后再决定要不要用 1 分钟数据做微调。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考