尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

RVC变声器完整教程:10分钟语音数据,三步练出你的AI音色

RVC变声器完整教程:10分钟语音数据,三步练出你的AI音色 RVC变声器完整教程10分钟语音数据三步练出你的AI音色【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUIRVC是一个基于 VITS 架构的变声框架核心卖点是数据量小README 给出的建议是至少收集 10 分钟低底噪语音就能得到可用的音色模型。这篇教程不按安装—训练—推理的流水账写而是给你一条可以直接跑通的主线——从环境检查、训练出第一个 .pth 模型到调出像样的推理效果——排障内容全部收敛成一张速查表。仓库是只读的文中所有路径都可以直接点开对照。RVC 环境配置三个检查点RVC 的环境问题 90% 出在三件事上Python 版本、FFmpeg、预训练权重。逐项确认比事后排错快得多。1. Python 版本python --version选 3.8–3.10 的稳定版。不要用 3.11依赖中的 llvmlite 0.39.0 在更高版本上会直接装不上官方 README 明确写了这一点。如果是用 Poetry 管理依赖3.7–3.10 都是可接受区间。2. FFmpegffmpeg -version训练和推理的音频切分、转码都靠它没有它整个流程跑不起来。Linux 用apt install ffmpegmacOS 用brew install ffmpegWindows 最省事的办法是把 ffmpeg.exe / ffprobe.exe 直接放到项目根目录。3. 预训练文件RVC 自带模型不够用需要补四类文件assets/hubert/hubert_base.pt声码器前端特征提取、assets/pretrained/v1 底模、assets/uvr5_weights/UVR5 人声分离模型、根目录的rmvpe.ptRMVPE 音高提取权重。v2 模型再额外下assets/pretrained_v2/。仓库里已经提供了下载脚本见 tools/download_models.py不用手动拷文件。三条都通过后再启动避免装到一半发现缺东西python infer-web.pyWindows 整合包用户双击go-web.bat即可效果等同。RVC 训练主线从原始音频到 .pth 模型这一节是唯一需要你动手的部分分四步切数据 → 提特征 → 训练 → 核对产物。第一步切数据。音频切成 5–10 秒的片段单文件太长容易拖慢训练、太短又学不到完整音色特征。总量上10 分钟是能用的下限10–50 分钟是舒适区几小时的低质音频不如 15 分钟的干净录音。采样率统一 48kHz——训练时选 32k/40k/48k 只影响音质上限和文件大小混着不同采样率训练则会明显翻车所以统一 48k是硬建议。人声和伴奏混在一起的素材先走 UVR5 分离出纯人声再切。第二步提特征。WebUI 里选音高提取算法直接选 RMVPE它是 Interspeech 2023 的方案效果显著好于其他选项且比 crepe 更快、更省资源还能根绝哑音。这步不用纠结。第三步训练参数。两个关键旋钮和显存强相关batch_size显存大就开大4–8训练更稳、更快4GB 显存压到 1–2。用nvidia-smi查占用能再大 1 就再大 1。epoch数据质量高给 100–200 轮数据一般 20–30 轮就停。轮数不是越多越好过拟合的模型会塑料感加重。学习率保持默认即可手动调大只会让训练不稳。第四步核对产物。训练完成后看两个地方logs/实验名/下应有G_{epoch}.pth和D_{epoch}.pth生成器和判别器各存一份weights/下应出现约 60–100MB 的 .pth 模型文件这就是后面推理要用的主模型。低显存用户的额外提示configs/config.py 会根据显存大小自动选择x_pad / x_query / x_center / x_max一组更小的缓存参数6G 显存、5G 显存、4G 以下各一套预设。如果训练中途仍报 CUDA out of memory把这四个值再手动调小一档即可不必放弃训练。RVC 索引训练与推理参数怎么调模型训完先别急着推理还差一步训练 faiss 索引。faiss 在这里的作用是把训练集的音色特征建成可检索的库推理时用 top1 检索替换源声特征——这正是 RVC 名字里 Retrieval-based 的来源也是它杜绝音色泄漏输出里混入原说话人音色的机制。在 WebUI 索引页点训练等进度到 100%产物落在assets/indices/扩展名 .index。推理时有三个参数真正影响听感其余保持默认参数建议值作用Index Rate0.6–0.8检索特征的混合比例0 完全不检索1 全量替换。越高越彻底消除源音色但过高会损失自然度0.6–0.8 是音色和音质的平衡点Protect默认 0.5保护输入中接近非人声频率的成分防破音。出现尖锐破音时往下调出现嗡嗡声时往上调f0_up_key0变调半音数±12 为一个八度。男转女通常 8 到 12按素材试代码里的实现可以直接对照infer/modules/vc/pipeline.py 中f0 * pow(2, f0_up_key / 12)就是半音换算索引混合则是index_rate * 检索特征 (1 - index_rate) * 原始特征的线性插值——理解了这个公式调参就不会是玄学。采样率务必与训练时一致音调变换不确定时选自动先跑通再细调。RVC 报错速查表训练和推理阶段的常见报错按关键词对号入座报错关键词原因处理CUDA out of memory显存不够batch_size 减半再降 config.py 的 x_pad/x_query 四参数llvmlite.dll缺失缺 VC 运行库安装 Visual C Redistributablepip install llvmlite --no-cache-dir重装Expecting value/ JSON 解析失败configs/ 下 json 被代理污染或损坏关系统代理检查 configs/ 各 json 是否合法不行就恢复默认浏览器连不上 7860端口被占或终端已关保持命令行窗口开着netstat -ano \| findstr :7860查占用后换端口weights 里没有 .pth训练没跑完回训练页确认日志出现收尾提示检查 logs/ 下 G/D 文件是否齐全通用原则两条全程用英文路径、不要中文文件名configs/ 目录改动前留个备份。进阶模型融合与实时变声 两项值得在第一个模型跑通后做的事ckpt 融合。在 WebUI 的 ckpt 处理选项卡里做 ckpt-merge把两个模型按权重混合常见 0.5:0.5 起步用来微调音色偏置。融合完记得用不同风格的音频各测一段和融合前对比后再定最终比例。实时变声。跑go-realtime-gui.bat打开实时界面。官方数据普通声卡端到端延迟 170ms换 ASIO 驱动的声卡可压到 90ms——延迟对硬件驱动依赖很大声卡驱动比参数更值得折腾。上手清单现在就可以做的三件事按环境配置一节跑完三个检查命令缺权重就执行 tools/download_models.py然后python infer-web.py把界面开起来。拿 15 分钟左右的干净录音走完训练主线切 5–10 秒片段 → 48kHz → RMVPE → batch_size 按显存放 → 100–200 轮重点盯weights/里是否产出 .pth。训完立刻生成索引推理时从 Index Rate 0.7 起步微调破音再动 Protect。更多细节可以查仓库自带的文档docs/cn/faq.md中文问答、docs/en/training_tips_en.md训练技巧英文版、推理核心代码在 infer/lib/。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表