尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

如何用RVC变声器:10分钟克隆音色的完整指南

如何用RVC变声器:10分钟克隆音色的完整指南 如何用RVC变声器10分钟克隆音色的完整指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRetrieval-based-Voice-Conversion-WebUI简称 RVC基于 VITS 架构做语音转换能替你完成一件事让游戏角色换一个不暴露本人声线的声音。它用 top1 检索把输入源的特征替换成训练集里的特征从根源上抑制音色泄露。你只需要约 10 分钟的低底噪语音就能在普通显卡上训出一个可用音色实时变声端到端延迟可到 170ms。花10分钟值不值结论值得三个数据点能支撑这个判断。数据量小官方建议至少收集10 分钟低底噪语音即可训出较好结果。硬件门槛低在相对较差的显卡上也能快速训练支持 A 卡 / I 卡加速。延迟可控实时变声界面端到端延迟170ms换用 ASIO 输入输出设备可压到约90ms。先把它跑起来先看清单再按编号执行。环境清单Python 版本大于 3.83.7–3.10 更稳FFmpeg / FFprobeN 卡需装对应 CUDA 的 PyTorch预训练模型文件assets/下的 hubert、pretrained 等安装步骤N 卡为例pip install torch torchvision torchaudio # PyTorch核心已装可跳过 pip install -r requirements.txt # N卡依赖 # A卡/I卡改用 requirements-dml.txt # AMD ROCm 改用 requirements-amd.txt启动与模型准备安装 FFmpegUbuntusudo apt install ffmpegMacOSbrew install ffmpegWindows 把 exe 放到根目录。用 tools/ 里的dlmodels.sh/dlmodels.bat下载预模型或直接补齐 assets/ 缺少的文件。想用 RMVPE 音高提取把rmvpe.pt放到项目根目录。启动界面python infer-web.py # 默认监听端口 7865Windows 用户也可直接双击go-web.bat实时变声用go-realtime-gui.bat。端口冲突时用--port参数或改 configs/config.py 里的默认值7865。拿它做三件事每个场景都按输入 → 操作 → 产出三步走。场景一AI 歌手输入目标歌手的演唱音频约 10 分钟起。操作WebUI 训练页选实验名、勾选是否考虑音高跑一键训练再点训练索引。产出weights/下约60MB的.pth模型 对应.index可加载进推理页换音色。场景二人声与伴奏分离输入一首完整歌曲。操作调用内置 UVR5 模型做人声 / 伴奏分离。产出干净的人声干声供后续换声使用。场景三模型融合换音色输入两个已训好的模型。操作ckpt 处理页的ckpt-merge做融合。产出介于两者之间的新音色用来微调风格。用一句类比讲透原理把它想成配音演员对口型。传统端到端模型像演员自由发挥容易把你原本的声音也带出来RVC 多了一步检索——它从你训练集里翻出最接近当前内容的一段特征让模型照着这段标准答案来唱。因为输出的音色永远锚定在训练集上而不是你输入的原始声音所以音色泄露被从机制上压住了。检索这一步就是 top1 替换源特征。把效果调上去先备数据再调参数。数据准备要点采样率统一48kHz对应configs/v2/48k.json。片段5–10 秒总量10 分钟起越干净越好。去掉静音与背景噪声音量标准化剔除坏文件。参数对照表参数建议值说明采样率48k质量上限配置在 configs/v2/batch_size4显存紧张改 1–2来自 v2/48k.json学习率1e-4默认一般无需动轮次高质量 100–200低质量 200–300按需上调音高算法RMVPE质量最好且比 crepe 更省资源音高算法对比算法特点适合场景RMVPE效果最好显著优于其他资源占用小默认推荐Harvest低音好但非常慢追求低音质量PM最快输入歌声、提速CREPE效果好但吃 GPU显存充足显存配置参考级别显卡内存适用入门6GB 级8GB基础训练与推理进阶12GB 级16GB高质量模型专业24GB 级32GB批量与实时翻车了看这里只列最高频的五问答案取自 docs/cn/faq.md。Q1报 ffmpeg error / utf8 error多半是路径问题。音频路径带空格、括号等特殊符号或训练集音频带中文路径都会触发。把路径改成纯英文、无空格即可。Q2一键训练结束没有索引出现 Training is done 即模型训练成功紧邻报错是假的。若没有.index文件多为训练集过大卡住重新点一次训练索引即可。Q3推理时没看到训练集音色先点刷新音色还没有就检查训练是否报错把控制台和logs/实验名下的 log 截图留存。Q4该分享哪个模型文件分享weights/下60MB的.pth而不是logs/里几百 MB 的实验状态文件。后者用于复现与续训。Q5Connection Error 或 Expecting value前者通常是控制台窗口被关掉了后者请关闭本机 / 服务端的代理设置。接下来往哪走文档入口中文 FAQdocs/cn/faq.md训练技巧docs/en/training_tips_en.md音高检索调优docs/en/faiss_tips_en.md多语言 README 均在 docs/ 下社区官方 Discord 群实时技术支持Issue 区反馈与功能建议分阶段学习路径入门1–2 周跑通环境训出第一个模型掌握基本参数。进阶1–2 月上手模型融合与索引调优。精通3–6 月读透 infer/lib/ 核心源码参与改进。上手三步先备齐 10 分钟干净音频再开训。默认选 RMVPE 48k再逐项调参。分享模型认准weights/下 60MB 的.pth。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表