尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

RVC语音克隆实战教程:10分钟干声,一次训练出专属AI歌手

RVC语音克隆实战教程:10分钟干声,一次训练出专属AI歌手 RVC语音克隆实战教程10分钟干声一次训练出专属AI歌手【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI一段10分钟的干声跑完一次训练就会变成一个能唱、能配音的新音色。这就是RVCRetrieval-based-Voice-Conversion-WebUI能给出的结果一套在本地运行的语音克隆工具打开Web界面点点鼠标就能完成一次AI歌手制作。这篇RVC语音克隆教程带你从克隆仓库到出第一个音色每一步都不跳过。 它能接住哪些场景AI歌手把你的干声套进任意一首伴奏歌手就成了你自己。视频配音把一段旁白的原始音色批量换成指定声音。直播或语音聊天边说边转换端到端延迟约170ms。 环境安装从克隆仓库到打开界面先把代码拉到本机需要Python 3.8及以上git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI克隆完成后后面所有命令都在这个目录里执行。接着装依赖按你的显卡选对应那一行# N卡 pip install -r requirements.txt # A卡 / I卡DirectML pip install -r requirements-dml.txt # I卡 IPEXLinux pip install -r requirements-ipex.txtLinux上的AMD显卡用户改执行pip install -r requirements-amd.txt即可。然后用仓库自带的脚本下载训练和推理都要用的预训练模型文件python tools/download_models.py看到 assets/hubert、assets/pretrained 等目录里出现新的 .pt 文件说明下好了。最后启动Web界面python infer-web.py浏览器打开终端里打印的地址训练和推理的界面就出来了。️ 训练实操数据、参数与验证数据要求很简单干声10分钟起步底噪越小越好。WAV格式采样率建议44100Hz。避开长时间静音和重混响片段。素材带伴奏的先用界面里的UVR5页签分离出人声。真正影响效果的参数只有四个total_epoch 总训练轮数建议20–30轮更多不一定更好。batch_size界面会按显存给出建议值报显存错误就改到1。index_rate决定结果向目标音色靠多近先保持默认。pitch男转女一般12女转男一般-12。 其余参数保持默认即可直接点开始训练等它跑完。训练结束后用耳朵做三件事自检听有没有电音感有就说明音高提取或偏移有问题。听音色像不像训练集越像说明数据越干净。听是否发闷、发飘是的话后面要调高 index_rate。 效果调优从能跑到好听旋钮怎么调对应什么问题pitch男转女12到15女转男-12到-15整体音高比原声高一截或低一截index_rate训练集一般取0.3–0.7训练集好就调高音色串了原声或相似度不够音高提取算法默认RMVPEcrepe最准但最慢harvest适合高质量录音跑调、哑音、破音明显RMVPE 是从人声里提取基频的音高提取算法多数素材选它就够。只有精度明显不够时才换crepe试试。 进阶玩法实时变声运行tools/rvc_for_realtime.py端到端延迟约170ms用ASIO音频设备可降到约90ms。模型融合把两个训练好的模型按权重混合得到一个新音色用WebUI的ckpt-merge页签或tools/infer/trans_weights.py脚本都能做。人声伴奏分离UVR5页签可以从歌曲里抽人声、或只留伴奏给训练数据做准备很方便。 排错清单看到什么就查什么训练报显存不足→ 多半是 batch_size 太大 → 改到1切32000Hz采样率模式重新训练。训练完了推理时选不到索引→ 索引训练没跑完或被打断 → 手动点训练索引按钮重新生成训练集文件太多就先减少数量。实时变声明显跟不上→ 后台程序占资源或缓冲区过大 → 关掉后台程序调低采样率换ASIO兼容声卡。转换后声音像电音→ 音高提取错了或没校正 → 算法切到RMVPE再把pitch按±12逐格调到与原声同调。结果噪声明显、音色不像→ 训练数据底噪大或时长不够 → 先用UVR5去噪素材扩到10分钟以上重新训练。 资源入口中文文档docs/cn/含常见问题和更新日志。多语言界面文件i18n/locale/共13种语言。推理主配置configs/config.json推理参数都在这。英文训练建议docs/en/training_tips_en.md。顺带提醒一句音色模型请只用于个人创作别拿去模仿特定真实人物的声音。回到开头10分钟干声足够做出一个能用的新音色。先拿自己的声音训练一个再凭耳朵把 pitch 和 index_rate 调到位这就是上手RVC最快的路径。【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表