尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

UVR 人声分离实战指南:三步提取干净干声

UVR 人声分离实战指南:三步提取干净干声 UVR 人声分离实战指南三步提取干净干声【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui给混音留一条干净的人声干声或做一首 K 歌伴奏。背后都是同一个动作音频分离。UVR 是一款基于深度神经网络的图形化人声提取 / 伴奏分离工具。从装环境到出干声走通这条路径。你就完成第一次 UVR 人声分离。UVR 能干什么核心能力速览输入一首歌UVR 拆成人声和器乐输出 WAV、FLAC、MP3。当前版本 v5.6.0。内置多套模型MDX-Net 系列、VR 架构、Demucs v3 / v4 四音轨权重文件都在 models/ 目录算法可切换主界面下拉框在 MDX-Net、VR、Demucs 之间切换各适合不同素材三平台覆盖Windows 一体化安装包、macOS 双架构 dmgM1 带 MPS 加速、Linux 脚本安装输出灵活WAV / FLAC / MP3 三选一附带时间拉伸、变调后处理硬件加速可选NVIDIA 走 CUDAAMD / Intel 独显走 OpenCL纯 CPU 也能跑环境准备最短安装路径按操作系统挑最短路径Windows 装一体化包最省心。Windows 10 以上直接装 UVR_v5.6.0_setup.exePython 和依赖都打包在内。官方要求装在 C 盘装到其他盘会不稳定。AMD / Intel 独显用户改选 OpenCL 版。macOS 按芯片选 arm64 或 x86_64 的 dmg。M1 芯片的 MPS 加速已覆盖 Demucs v4 和全部 MDX-Net 模型。首次启动可能等 5 到 10 分钟。Linux 或想手动装的话先补两个系统依赖图形界面要 python3-tkMP3 和 FLAC 的格式转换靠 FFmpeg。git clone https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui cd ultimatevocalremoverguisudo apt install ffmpeg python3-tk python3-pippip3 install -r requirements.txt python3 UVR.py嫌逐条装麻烦用 install_packages.sh 照着 requirements.txt 把依赖装齐。有 NVIDIA 独显就装 CUDA 版 PyTorch没有装 CPU 版界面里的 GPU Conversion 勾选框才会真正提速。核心操作流程界面从上到下就是选文件、选算法、点开始三步出干声。第一步确定输入与输出。点左上角 Select Input 选要处理的音频Select Output 指定结果目录。右侧单选框决定导出格式首次用选 WAV保真度最高。两个路径框都填入界面就算就绪。目录就绪后往下选算法和模型组合决定分离效果。第二步选算法与模型。在 CHOOSE PROCESS METHOD 下拉框里选 MDX-Net这是首次使用的稳妥选项。下方 CHOOSE MDX-NET MODEL 选 MDX23C-InstVoc HQ它是默认的人声分离主力模型。有独显就把 GPU Conversion 勾上处理速度提升数倍。选完模型框停在 MDX23C-InstVoc HQ配置就绪。模型选定后点底部大按钮开始跑。第三步点 Start Processing 出干声。进度条和控制台实时反馈分离进度。完成后去输出目录找带 Vocals 和 Instrumental 后缀的两个文件干声就在手里了。另外三个勾选框按需使用Vocals Only 只出人声Instrumental Only 只出伴奏Sample Mode (30s) 只跑前 30 秒。换模型前先用它试听能省大量等待时间。右侧 SELECT SAVED SETTINGS 可存整套参数多个文件用同一套设置连跑就是批量处理。参数选择与效果调优先按素材类型定模型参数只需要碰三处。按素材类型选模型流行曲提人声MDX-Net MDX23C-InstVoc HQ默认组合就是为这种场景调的做卡拉 OK 伴奏UVR-MDX-NET Karaoke 或 Karaoke 2去人声更彻底编曲复杂要拆多轨Demucs v4一次分出 Vocals / Drums / Bass / Other 四条现场录音混响重VR 架构对这类素材适应性更好UVR 人声分离参数怎么调Segment Size分段大小复杂素材用 256 或 512简单音频 1024 换速度它也是显存 / 内存占用的开关机器小就往下调Overlap重叠度默认 8 基本不用动调高过渡更平滑但更耗时Sample Mode (30s)30秒试跑每次换模型先跑它听完再决定全曲跑不跑拿不准就用这套默认配置MDX-Net MDX23C-InstVoc HQSegment Size 512Overlap 8输出 WAV。高频问题与排错五个高频坑每个都有具体解法。内存或显存报错Memory allocation errorSegment Size 开太大 → 从 1024 降到 512 或 256关掉后台占显存的程序MP3、FLAC 读不进来系统缺 FFmpeg → 装好 FFmpeg 后重启程序WAV 文件不受影响NVIDIA 卡勾了 GPU 却没加速只认 CUDA 版环境 → 确认装的是 CUDA 版 PyTorch独显至少 RTX 1060 6GB、推荐 8GB 显存显存不够就降一档 Segment SizeAMD / Intel 显卡点不了 GPU装的是 CUDA 版 → 换 OpenCL 版安装包CUDA 版不认这两家显卡时间拉伸、变调不可用缺 Rubber Band 库 → 把对应系统的 rubberband 可执行文件放进应用目录延伸场景与硬件参考干声拿到的下一步是重混和批量。干声可以进 DAW 重混、加和声去人声的伴奏轨直接当 K 歌用。含杂音的录音先分离出人声再交给降噪工具精修。批量任务把参数存进 SELECT SAVED SETTINGS 连跑真正脚本化可以基于 separate.py 的分离流程封装自己的调用逻辑。硬件心里有个数档位配置最低8GB 内存 集显或纯 CPU推荐16GB 内存 RTX 20 系以上独显进阶32GB 内存 RTX 30 系以上独显打开 UVR选一首你熟悉的歌勾上 Sample Mode 跑 30 秒第一条干声马上就到。【免费下载链接】ultimatevocalremoverguiGUI for a Vocal Remover that uses Deep Neural Networks.项目地址: https://gitcode.com/GitHub_Trending/ul/ultimatevocalremovergui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表