尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

GPT-SoVITS数据集制作全流程:UVR5人声分离、音频切片与ASR自动标注实战

GPT-SoVITS数据集制作全流程:UVR5人声分离、音频切片与ASR自动标注实战 GPT-SoVITS数据集制作全流程UVR5人声分离、音频切片与ASR自动标注实战【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITSGPT-SoVITS 是一款强大的少样本语音克隆与文本转语音TTS工具仅 1 分钟人声即可微调出高相似度模型。而微调效果好不好80% 取决于数据集质量。本文将带你走通 GPT-SoVITS 数据集制作全流程用 UVR5 完成人声分离、用自动切片工具切割音频、再用多语种 ASR 自动标注文字最后校对生成训练用的 list 标注文件新手也能一次做对。一、为什么数据集是成功的关键GPT-SoVITS 的核心卖点是少样本零样本5 秒参考音频即可直接合成少样本微调1 分钟左右的干净人声就能大幅提升音色相似度与真实感。但这 1 分钟数据必须是纯人声、无背景音乐、无杂音、逐句切好且文字标注准确的片段。原始素材通常是带 BGM 的完整歌曲或长语音直接喂给训练流程只会学歪。因此官方在 WebUI 中内置了一整套数据处理管线见 README.md 的Finetune一节填写音频路径 → 切片 → 去噪可选→ ASR 转写 → 文本校对 → 进入下一标签页微调模型下文就按这条管线逐步拆解。二、第一步UVR5 人声分离先去掉背景音乐如果你的素材是歌曲或带伴奏的录音第一步必须把人声轨分离出来。入口主界面 webui.py 启动后打开UVR5 人声伴奏分离标签页对应源码为 tools/uvr5/webui.py。操作要点选择模型uvr5_names列表会扫描 tools/uvr5/uvr5_weights 目录下所有.pth/.ckpt/ onnx 权重按需选用如 MDX-Net 分离、Roformer 分离、去混响 Dereverb 等。若本地没有权重安装时加--download-uvr5参数可自动下载填入待处理音频目录把原始歌曲/录音放入一个文件夹在界面上指定该目录输出两个结果目录分离后的人声vocal和伴奏instrumental会分别保存我们要用的是人声目录等待批量处理完成逐首试听人声轨确认没有残留伴奏。经验若人声带混响大厅感明显建议额外跑一次去混响Dereverb模型再切片效果更干净。三、第二步音频自动切片把长音频切成短句训练需要的是每句 3~10 秒左右的短片段。GPT-SoVITS 提供了基于能量RMS的静音检测切片器 tools/slicer2.py核心逻辑是扫描音量包络在低于阈值的静音段处下刀切割。入口WebUI 中训练集切割标签页或直接运行命令行版本 tools/slice_audio.py。关键参数及推荐值来自 slicer2.py 的Slicer默认配置参数含义默认值调参建议threshold低于该音量(dB)视作静音备选切割点-40环境噪音大时调低如 -45min_length片段最短时长(ms)5000保证每片信息量足够min_interval两次切割的最小间隔(ms)300避免切碎一个字hop_size扫描步长(ms)20一般不改max_sil_kept每片保留的最长静音(ms)5000控制片段首尾留白经验切完后抽听几个片段——如果一句常被从中间切断调大min_interval如果开头噪音多调低threshold并适当调小max_sil_kept。四、第三步可选去噪处理对于有底噪、电流声的录音可以在切片后使用内置去噪工具 tools/cmd-denoise.py模型位于 tools/denoise-model 目录。录制环境本来就比较干净的话这一步可跳过。五、第四步ASR 自动标注一键生成文字稿切片完成后GPT-SoVITS 内置的多语种语音识别ASR会逐段转写出文本省去逐条手打。相关源码中文/粤语tools/asr/funasr_asr.py集成 Fun-ASR-Nano多方言、SenseVoice快速转写与经典 FunASRParaformer/UniASR英日等语种tools/asr/fasterwhisper_asr.py基于 Faster Whisper语言代码覆盖zh、en、ja、ko、yue等数十种。操作要点选择语种与切片时的主语言一致中文选 FunASR 系英/日选 Whisper 系模型目录识别模型统一放在 tools/asr/models首次使用会自动下载也可提前手动放入实现离线使用点击批量识别后每条切片会对应生成一句文本并汇总为标注数据json/list。六、第五步文本校对生成训练 list 文件ASR 转写不可能 100% 准确专有名词、语气词最容易错。官方提供了文本校对界面 tools/subfix_webui.py加载上一步的标注结果后左侧播放音频、右侧逐条修改文本按批次翻页核对最后导出标注文件。最终训练数据集采用.list格式每行一条记录以|分隔四段信息格式定义见 README.md 的Dataset Format一节音频路径|说话人|语种|文本 例如 D:\GPT-SoVITS\dataset\0001.wav|myvoice|zh|今天天气真不错。其中语种代码zh中文 /en英文 /ja日文 /ko韩文 /yue粤语。⚠️校对三原则删掉没有实际内容的嗯、啊碎片片段在界面中可直接删除文本与音频严格对应宁缺勿错语种字段必须与片段实际语种一致混合语段落可拆行标注。七、常见坑与提速技巧切出来的片段带伴奏残留回到第一步换更强的分离模型Roformer 系通常更干净分离模型需与同名.yaml配置一起放入 tools/uvr5/uvr5_weights识别全是乱码先确认语种选对了再检查切片是否过短1 秒的片段识别质量差批量处理慢在 config.py 中确认 GPU 设备与半精度is_half已正确启用数据量建议1 分钟起步、5~10 分钟更稳同一说话人的素材风格越统一同样设备、同样语速微调效果越好。八、总结五步产出高质量训练集步骤工具核心文件1. 人声分离UVR5tools/uvr5/webui.py2. 音频切片Slicertools/slicer2.py、tools/slice_audio.py3. 去噪可选denoisetools/cmd-denoise.py4. ASR 标注FunASR / Whispertools/asr/funasr_asr.py、tools/asr/fasterwhisper_asr.py5. 文本校对subfixtools/subfix_webui.py完成以上五步你就拥有了一份可以直接投入微调的 GPT-SoVITS 数据集。接下来回到 WebUI 的训练标签页选择实验目录、指定.list文件即可开始训练 GPTs1与 SoVITSs2模型用 1 分钟声音复刻出属于你自己的 AI 音色。【免费下载链接】GPT-SoVITS1 min voice data can also be used to train a good TTS model! (few shot voice cloning)项目地址: https://gitcode.com/GitHub_Trending/gp/GPT-SoVITS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表