尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

RVC 变声实战:10分钟人声数据训练你的专属音色

RVC 变声实战:10分钟人声数据训练你的专属音色 RVC 变声实战10分钟人声数据训练你的专属音色【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI你手里只有一段10分钟的某人录音却想让整部电影、一段歌、一场直播都变成这个声音——Retrieval-based-Voice-Conversion-WebUIRVC就是干这个的用极少的干净人声数据训练变声模型把任意一段语音转成目标音色网页界面和命令行都给你配齐了。下面从装到跑再讲清楚每个关键参数全流程走一遍。 30秒把环境跑起来仓库对 Python 版本的要求是 3.8 以上两种方式任选pip 装依赖适合你自己管环境按显卡选清单N 卡用 requirements.txtA 卡/I 卡 DML 用 requirements-dml.txt源码克隆适合复现和二次开发克隆下来后依赖照样用上面的清单装git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI cd Retrieval-based-Voice-Conversion-WebUI pip install -r requirements.txt python infer-web.py最后一条命令会起一个 Gradio 网页浏览器打开后能看到人声分离、训练、推理几个页签。注意首次运行前还要按 README.md 的清单把assets/下的预训练文件补齐hubert_base.pt、pretrained、uvr5_weights 等缺一个对应功能就不可用。 它帮你解决什么输入一段带伴奏的录音 → UVR5 分离出纯人声 → 得到干净的训练底料。infer/modules/uvr5/ 内置了声轨分离器不用再去别的工具里折腾输入 10 分钟以上的单人干净音频 → 跑一遍训练 → 得到一个 .pth 音色模型。底模基于 VITS 架构、用约 50 小时的 VCTK 数据集预训练所以少量数据也能收敛出像样的音色输入你的说话音频 训练好的模型 → 推理 → 输出同内容但换了音色的 wav。音高用 RMVPE 算法提取这是 Interspeech 2023 的方案比老一代 crepe 快、占用小哑音问题基本消除关键特性就四条用 faiss 索引做 top1 检索把输入特征替换成训练集特征从源头掐断音色泄漏推荐至少 10 分钟低底噪数据在消费级显卡上训练速度可接受支持 ckpt 融合两个音色模型可以按权重混出新音色实时变声端到端约 170ms配 ASIO 音频设备可压到 90ms 从单条到批量核心用法递进第 1 步转一条。不想开网页就直接用命令行python tools/infer_cli.py --model_name myvoice.pth \ --index_path logs/myvoice.index --input_path test.wav \ --opt_path out.wav --f0method rmvpe跑完out.wav就是变声后的结果。--model_name指向 assets 权重目录里的模型--f0method选音高提取算法默认 harvest建议用效果最好的 rmvpe。第 2 步转一批。把--input_path换成一个放满 .wav 的目录、--opt_path换成输出目录换成 tools/infer_batch_rvc.py 跑带进度条逐条输出。第 3 步调手感。效果不满意先别重训下面这几个参数先拧一遍参数默认值说明f0up_key0输出整体升降调半音单位男转女一般 12 起步index_rate0.66检索索引的混合比例0 到 1调音色相似度filter_radius3中值滤波半径越大音高曲线越平滑rms_mix_rate1.0响度混合原声和目标音量的折中protect0.33保护阈值越大越不容易出破音但变声越不彻底 两个落地场景把一整部电影的台词批量换声三步UVR5 页签把每轨分离出干声 → 用 batch 脚本对着目录跑推理 → 换回原片音轨。注意 batch 脚本只认.wav后缀MP3 要先转格式--opt_path目录不存在会直接报错。实时变声直播或连麦三步启动 go-realtime-gui.batLinux/macOS 用对应入口→ 输入设备选麦克风或虚拟声卡 → 输出设备指向推流软件。注意 90ms 低延迟依赖 ASIO 驱动普通设备上按 170ms 预期体验跨平台的 configs/config.json 里已经留好了设备名的配置位。⚠️ 踩坑与调优现象老显卡显存爆、训练中途崩。原因模型按半精度跑显存紧张时梯度检查点也会吃空间。解法--device指定设备、确认已开半精度is_half实在不行就把训练数据切片时长调短。现象变声后的声音像捏着嗓子或出现气声。原因源音频里有笑声、呼吸、背景音protect 又设得太低。解法先把 protect 提到 0.4~0.5 试试再回头用 UVR5 重洗一遍训练集。现象v2 模型加载失败。原因v1 和 v2 依赖不同的预训练文件assets 下 pretrained 与 pretrained_v2 两套。解法对照 README.md 的清单把对应版本的预模型下全。两条性能建议# 批量推理时显存吃紧用半精度 指定设备 python tools/infer_batch_rvc.py ... --is_half True --device cuda:0批量转长音频优先半精度长音频建议先切片再进 batch单条太长容易 OOM音高提取选 rmvpe 而不是 crepe速度更快、资源占用更小这是官方明确标注的效果最优项限制也不回避训练数据低于 10 分钟、底噪大音色会明显打折扣实时模式的延迟数字依赖你的声卡驱动官方只保证非常依赖硬件驱动支持这个前提下才成立。 下一步做什么用 10 分钟数据训一个自己的音色拿一首歌做 A/B 试听感受 index_rate 从 0 到 1 的变化拿两个训练好的 .pth 做 ckpt 融合混出第三个人声用 tools/rvc_for_realtime.py 接进自己的实时链路改改推理调用即可值得翻的几处训练调参思路在 docs/cn/ 和 docs/ 各语言版含 faq 与 training_tips音高提取各算法实现在 infer/lib/infer_pack/modules/F0Predictor/索引训练脚本在 tools/infer/train-index.py。模型只用了你 10 分钟的声音效果却取决于这 10 分钟干不干净——先去洗数据。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表