尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GPT-SoVITS 语音克隆实战指南

GPT-SoVITS 语音克隆实战指南 GPT-SoVITS 语音克隆实战指南【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS一段 5 秒录音就能做 GPT-SoVITS 语音克隆先零样本合成再喂 1 分钟音频微调音色和语气会越来越接近真人。这套开源的 GPT-SoVITS 语音克隆工具把从录音到出音的全流程都搬进了一个 Web 界面里。环境三步搭好先装 conda再拉代码、建一个 3.10 的虚拟环境最后跑一条 install.sh把依赖和预训练模型一起下好就能用 python webui.py 起主界面。整包脚本会自动装 PyTorch、ffmpeg 和中文音素模型不用逐个配。硬件不用顶配下面这张表是起步线配置起步门槛GPU4GB 显存CUDA内存16GBPython3.10git clone https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS # 拉取代码 cd GPT-SoVITS conda create -n gptsovits python3.10 -y # 建 3.10 虚拟环境 conda activate gptsovits bash install.sh --device CU128 --source HF # 装依赖 下预训练模型 python webui.py # 启动主界面第一次合成全流程数据准备好后主界面里按顺序点四步就行。准备训练清单建一个 train.list每行是「音频路径|说话人|语言|文本」语言填 zh/en/ja/ko/yue录音01.wav|说话人A|zh|今天天气真好 录音02.wav|说话人A|zh|我们下午一起开会 录音03.wav|说话人A|en|This is a test sentence预处理与标注把切片后的音频丢进主界面依次跑人声分离、自动切片、语音识别再把 ASR 出来的文本逐条校对一遍——文本准不准直接决定最后听感。训练与出音先点 GPT 训练、再点 SoVITS 训练产物分别落在 GPT_weights/ 和 SoVITS_weights/。想命令行出音就用 GPT_SoVITS/inference_cli.py参考文本和目标文本各存一个 txtpython GPT_SoVITS/inference_cli.py \ --gpt_model GPT_weights/s1.ckpt --sovits_model SoVITS_weights/s2G.pth \ --ref_audio ref.wav --ref_text ref.txt --ref_language 中文 \ --target_text target.txt --target_language 中文 --output_path output参数怎么选版本别贪大数据少、显存小就先用 v2出音够用就停追求音质再上 v4但显存要吃紧epoch 也别拉太高v4 默认 2 轮最多 16 轮。音色不够像喂 1-5 分钟干净音频做少样本微调参考音频选 5 秒里最清晰的一段显存紧张把 batch 调小或关掉 fp16 跑 32 位数据偏少读着飘把 SoVITS 的 epoch 加到 8 左右盯着 loss 别过拟合踩坑笔记CUDA 版本不匹配→ 按显卡重装对应 PyTorch直接用 install.sh 的--device指定 CU126 或 CU128中文多音字读错→ 确认 G2PWModel 下到了GPT_SoVITS/text/里没下全就重跑 install.sh显存爆掉→ 关掉 fp16或把 batch_size 直接降一半资源导航官方文档docs/cn/README.md声学模型GPT_SoVITS/AR/models/推理界面GPT_SoVITS/inference_webui.py反馈问题去仓库 Issues 里提先拿一段自己 5 秒的录音跑一次零样本合成听感满意后再录 1 分钟干净音频微调把音色彻底锁死。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表