
RVC 语音模型上手实操用 10 分钟语音训练出可用的 VC 模型【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVCRetrieval-based-Voice-Conversion-WebUI是一个基于 VITS 的开源变声框架官方定位是用不超过 10 分钟的语音数据就能训练出效果不错的 VC 模型。它提供网页界面完成从训练集处理、模型训练到单次/批量推理的全流程适合想给自己或某位歌手做 AI 音色模型、又不想手写代码的用户。先弄懂它靠什么工作一句话RVC VITS 生成框架 top1 检索。底模用接近 50 小时的开源 VCTK 训练集预训练过你只用少量数据微调出目标音色推理时用 top1 检索把输入源特征替换成训练集特征从机制上杜绝音色泄漏结果声音往源音频或底模上靠。这也解释了它为什么在显存较小的显卡上也能快速训练。最小可用的安装命令环境要求 Python 大于 3.8外加 ffmpegUbuntu 用sudo apt install ffmpegmacOS 用brew install ffmpegWindows 可把 ffmpeg.exe、ffprobe.exe 放到项目根目录。依赖安装分两步pip install torch torchvision torchaudio pip install -r requirements.txtN 卡装requirements.txt即可A 卡/I 卡装requirements-dml.txtLinux 下的 AMD ROCm、Intel IPEX 分别对应requirements-amd.txt、requirements-ipex.txt。macOS 上也可以直接sh ./run.sh装依赖。装完依赖还差一批预模型清单在 README 里列了./assets/hubert/hubert_base.pt、./assets/pretrained、./assets/uvr5_weights想用 v2 底模再加./assets/pretrained_v2想用 RMVPE 音高提取把rmvpe.pt放到项目根目录。仓库的 tools/ 目录里带了dlmodels.sh和dlmodels.bat下载脚本直接运行省去手动搬运。启动 WebUI 并确认跑通python infer-web.pyWindows 用户直接双击go-web.bat更省事。默认监听端口 7865浏览器会自动打开界面看到模型推理训练集ckpt 处理设置选项这几个选项卡就算启动成功。界面里会显示检测到的显卡信息卡号与显卡的对应关系以后在推理配置时会用到。完整跑通一次一键训练训练集准备推荐 10 分钟至 50 分钟、底噪低的高质量语音切成 5-10 秒的短片段放进同一个文件夹文件名和路径不要带空格、括号等特殊符号路径不要有中文。音质高、时长足的优质数据 200 轮都 OK底噪大的数据 20-30 轮就够调高了也带不回来。操作路径打开训练集选项卡 → 输入实验名建议英文和训练集路径 → 采样率选 48k → 总训练轮数按数据质量填 30 或 200 → 批量大小保持默认 4显存不够就调小→ 音高提取算法保持默认 rmvpe效果最好且只微吃 GPU→ 点一键训练。看到什么算成功控制台出现Training is done. The program is closed.即训练完成后面紧邻的报错可以无视。产物有两处weights/下出现 60MB 以上的 pth 文件这是用来推理和分享的模型logs/实验名/下出现added_开头的 index 索引文件和几百 MB 的中间 pth仅供复现和续训不要直接拿来推理。推理验证切到模型推理选项卡 → 点刷新音色列表和索引路径 → 下拉选择刚训的音色 → 填入待处理音频路径 → 变调填 0升八度 12、降八度 -12→ 音高提取算法选 rmvpe → 点转换。输出的 wav 在 output 目录听感上音色贴合训练数据、无电音撕裂这次实战就算跑通了。踩坑速查现象原因处理ffmpeg error / utf8 error音频路径含空格、()等特殊符号或训练集在中文路径换到纯英文无空格路径一键训练结束没有 index 文件训练集太大添加索引步骤卡住再点一次训练索引把 logs 下几百 MB 的 pth 拿去推理报 key 不存在那是存实验状态/续训用的中间文件分享或推理用weights/下 60MB 的 pth只有中间 pth 时去ckpt 处理选项卡做小模型提取CUDA out of memory显存不足训练调小 batch_size推理调小configs/config.py里的 x_pad、x_query、x_center、x_max4GB 以下显存基本没救Windows 报llvmlite.dll加载失败缺微软 C 运行库装 vc_redist.x64.exe 后重启 WebUI继续深入看哪里docs/cn/faq.md官方问答覆盖采样率、index rate、中断续训、GPU 选择等 18 个问题docs/cn/Changelog_CN.md版本更新日志configs/config.py改端口默认 7865、设备cuda:0卡号、推理显存参数tools/dlmodels.sh / tools/dlmodels.bat预模型下载脚本实时变声走go-realtime-gui.bat官方称端到端延迟 170ms用 ASIO 设备可到 90ms适合不想碰 WebUI 的进阶玩法【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考