
10 分钟走完第一次人声伴奏分离UVR5 人声提取免费开源完整新手指南【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUIRVC WebUIRetrieval-based-Voice-Conversion-WebUI项目内置了 UVR5 人声提取模块它负责把一段音频拆成人声与伴奏两份独立文件。这篇人声伴奏分离教程写给零基础读者不预设任何信号处理背景从安装、参数填写到验收与问题定位全部流程一次讲完。 一、它是什么、适合谁、边界在哪先判断你属于哪一类再决定要不要继续翻唱创作者手里有一首歌只想留下干净的伴奏自己录唱后合成一版翻唱。播客 / 访谈后期录音里带明显的房间回声混响就是说话声之后拖着的尾巴发布前需要清理。命中任意一种就可以直接开始。整个过程不需要理解信号处理原理指定一个音频文件夹、点一次按钮跑完你会得到两个结果文件夹——人声一份非人声伴奏一份。能力边界列在下面提前对齐预期维度说明能做对整个文件夹批量做人声伴奏分离导出格式支持 flac、wav、mp3、m4a 四种能做去混响、去延迟。MDX-Net 模型 onnx_dereverb_By_FoxJoy 处理双通道立体声混响DeEcho 系列处理回声与单声道混响不能做实时分离每个文件都要等整段处理完不能做把单通道混响除干净MDX-Net 只支持双通道输入应有预期分离是把信息拆开的过程伴奏里残留少量人声、人声里掺入一点伴奏属于这类算法的正常表现不是环境装坏了 二、准备工作装环境、下模型总共三步命令可直接复制执行。第 1 步拉取代码git clone https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI第 2 步按显卡装依赖三个文件对应三种硬件选一个执行硬件命令NVIDIA 显卡pip install -r requirements.txtAMD 显卡pip install -r requirements-amd.txtIntel 核显 / 独显pip install -r requirements-ipex.txt第 3 步下载 UVR5 权重并启动界面。先跑下载脚本Windows 执行tools/dlmodels.batLinux/Mac 执行tools/dlmodels.sh权重会存入assets/uvr5_weights/目录。下载完成后启动界面Windows 双击go-web.batLinux/Mac 运行bash run.sh浏览器会自动打开主界面。若启动后「模型」下拉框里空空如也见第五节的模型下载失败处理流程。⚙️ 三、第一次分离模型怎么选、参数怎么填进入界面顶部的「伴奏人声分离去混响去回声」标签页本节所有字段都在这一屏内。模型选对其余参数才有意义模型适用情况HP2无和声的歌曲保留主人声整体最均衡HP3与 HP2 类似主人声保留更完整代价是可能轻微漏进伴奏HP5带和声的歌曲只留主旋律人声主人声可能被略微削弱onnx_dereverb_By_FoxJoy去双通道混响即 MDX-Net 模型DeEcho-Normal / Aggressive / DeReverb去延迟、去混响Aggressive 处理更彻底DeReverb 额外去混响但耗时接近 2 倍其余字段按这张表填字段建议输入待处理音频文件夹路径填待处理音频所在目录也可直接勾选多个文件但填了文件夹时优先读文件夹人声提取激进程度聚合度默认 10取值范围 0-20。数值越高人声剥离越干净但被从伴奏里一并带走的频率成分也越多导出文件格式默认 flac无损格式指不通过压缩损失音质。后续还要加工就选 flac 或 wav存档或分享选 mp3 更省空间指定输出主人声 / 非主人声文件夹保持默认opt结果会分别写入两个子目录采样率一项不用手动处理程序会检测源文件只要它不是 44100Hz 双声道就会先用 ffmpeg 自动重编码成 44100Hz 双声道再进入分离流程。你唯一要注意的是别拿过度压缩的低码率文件当源。全部填完点「转换」右侧「输出信息」区会逐行打印文件名-Success每一行都是 Success 即代表全部完成。 四、验收与调参怎样算分离成功跑完后先各听一遍两个输出文件夹的验收标准不同主人声文件夹人声是否完整、没有断档有没有明显的伴奏音混进来非主人声文件夹还能不能听出歌唱痕迹伴奏本身是否自然两边都过关这次分离才算合格任一边不过关再往下调。第一优先级是聚合度调整策略如下伴奏里人声残留偏多把聚合度从 10 往 12-15 抬人声发薄、伴奏味太重往 8 降一次只动 2 档改完先听再决定下一步不要跳着试同时记住源文件决定上限。单声道、低码率 MP3、已经严重削波声音失真的文件效果天花板就在那儿——模型只能分离信息本身已经有的内容无法补回丢失的部分。怀疑效果差时先换一份无损源文件重跑再下结论。️ 五、出了问题怎么查别急着重装环境按「模型 → 参数 → 源文件 → 环境」顺序过一遍速查表多数问题在前三项内就能定位症状可能原因处理办法歌里的和声被当成主人声留住了模型选错带和声的歌用了 HP2/HP3或去混响场景误选了 HP5对照第三节的模型表换正确模型重跑伴奏里人声残留多或人声发薄、伴奏味重聚合度与实际需求不匹配按 2 档步进调整残留多往 12-15 调人声薄往 8 调两边效果都平庸、没有明显提升源文件质量差单声道、低码率、削波更换无损源文件重跑一次输出信息出现报错堆栈依赖缺失或版本不匹配确认权重在assets/uvr5_weights/中缺失会直接找不到模型AMD 用户核对 requirements 文件是否选错torch 与显卡不匹配是高发项具体报错含义见 docs/ 目录下对应语言的 faq模型下载失败的处理步骤检查assets/uvr5_weights/目录内是否存在以.pth结尾的权重文件不存在则重新运行一次tools/dlmodels.bat或tools/dlmodels.sh仍失败时从项目文档中找到对应下载链接手动将权重文件放入assets/uvr5_weights/重启界面后「模型」下拉框即可选中 六、进阶玩法翻唱、播客清理、视频重新配音做翻唱关键顺序是 HP3 抽伴奏 → 录入自己的演唱 → 在剪辑软件里把两条轨叠到同一时间轴对齐节拍点即可。清理播客先过一遍 onnx_dereverb_By_FoxJoy 去掉房间回声再用 DeEcho-Aggressive 收一遍残留。对双通道录音这个两步组合是官方文档推荐的最干净配置优于单跑一个模型。给视频重新配音先把视频音轨导出为音频文件 → 用 UVR5 把原声人声与背景音乐分离 → 保留伴奏轨作垫底人声轨替换为你的配音 → 最后按段落拉平音量。✅ 七、收尾行动清单assets/uvr5_weights/里有一组权重、手里有一个立体声音频文件UVR5 人声提取就只剩下填个文件夹、点一下按钮。接下来按序做四件事挑一首干净的立体声歌曲用 HP3 完整跑一遍两个输出文件夹各完整听一遍标记人声残留和漏伴奏最严重的时间点再用聚合度 12 和 8 各跑一次做 A/B 对比去混响场景下按 MDX-Net → DeEcho-Aggressive 的顺序对双通道录音试一遍分离效果稳定后把提出的人声直接接入 RVC 主界面进入后续变声流程【免费下载链接】Retrieval-based-Voice-Conversion-WebUIEasily train a good VC model with voice data 10 mins!项目地址: https://gitcode.com/GitHub_Trending/re/Retrieval-based-Voice-Conversion-WebUI创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考