尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

OpenVoice 免训练语音克隆:几秒音频复刻音色,附本地部署避坑

OpenVoice 免训练语音克隆:几秒音频复刻音色,附本地部署避坑 OpenVoice 免训练语音克隆几秒音频复刻音色附本地部署避坑【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoiceOpenVoice 做语音克隆几秒干净人声就能复刻音色让 AI 用这个音色朗读任意文字免训练直接上手。项目由 MIT 与 MyShell 开源V1、V2 均为 MIT 协议商用免费。本地跑需要带 GPU 的机器显存 4GB 起步没硬件就直接走官方在线服务零安装。先跑起来3步在线语音克隆不用装软件官方 Workshop 三步出克隆语音打开 MyShell Workshop新建一个 Bot。在 Settings 里开启 Voice (TTS)。进 Widget Center 的 TTS 分类挑一个基础音色并试听。然后用 voice cloning 上传参考音频、输入要朗读的文本几秒后拿到克隆结果。语言入口有英式英语、美式英语、中文、日语、韩语、西班牙语、法语等 9 个参考音频本身可以是任意语言。语音克隆基础音色选择Widget Center 的 TTS 分类可试听本地部署 V1 和 V2 流程一样LinuxPython 3.9conda create -n openvoice python3.9 conda activate openvoice git clone https://gitcode.com/GitHub_Trending/op/OpenVoice cd OpenVoice pip install -e .装完把官方权重解压到checkpointsV1或checkpoints_v2V2目录再运行python -m openvoice_app --share启动。跑起来后浏览器会打开一个 Gradio 页面左侧传参考音频右侧输入文本点一下就能听到克隆出来的语音。它到底怎么运作的如果你要手动走一遍数据会这样流动文本加风格参数情感、语调、节奏先进基础 TTS 模型负责把文字生成语音的模型合成一段带目标风格的语音然后音色提取器把音频压成音色特征向量的部件分析参考音频拿到说话人的音色特征最后音色转换模块把合成语音的音色替换成参考人的风格参数一点不动。出来的就是一位像那个人、情感节奏却由你指定的语音。音色和风格解耦所以可以各调各的。别指望它能做到这些✅ 能做到❌ 做不到上传几秒干净人声即可克隆音色生成同音色语音只克隆音色不克隆情感、口音音色与风格解耦情感、语调、节奏可单独调想换情感或口音得换基础 TTS 模型换参考音频没用V2 原生支持英、西、法、中、日、韩 6 种语言支持跨语言零样本克隆基础 TTS 模型不支持的语言无法直接输出参考音频可以是任意语言参考音频必须干净无背景噪音、单人说话、时长别太短所以如果你的需求是复刻原视频里的语气和情感这个项目不适合你它只管音色。部署时大概率会撞上的坑没有 GPU 或显存小于 4GB直接转用官方在线服务或换一台带显卡的机器再部署别硬跑。启动报找不到模型权重漏下了checkpoint 必须解压到checkpointsV1或checkpoints_v2V2目录解压后重新运行。首次运行卡在下载se_extractor.py里的 silero-vad 组件负责判断音频里哪里有说话声首次调用会自动联网下载。断网环境手动下载后解压到~/.cache/torch/hub/对应目录。V2 提示缺依赖除主包外还要装 MeloTTS 相关组件具体命令以 使用文档 里的 V2 一节为准。生成的声音不像依次查参考音频有无背景噪音、是否多人同说、时长是否太短、有无长静音段。同名文件复用注意先删掉processed缓存目录。拿来能干什么 视频配音换解说员音色不用重录原节奏不变 有声内容与播客同一音色批量产出中英文朗读不用请多个配音员 语音助手让智能设备用熟悉的声音回应你 多语言学习同一位人用不同语言读同一段文本对比发音与语调最后把音色克隆与风格合成解耦是 OpenVoice 最值得借鉴的设计音色转换器只管音色风格交给基础 TTS系统好扩展、好替换。几秒音频、MIT 协议、商用免费普通开发者当天就能接进自己的产品。延伸阅读使用文档、常见问题、核心源码【免费下载链接】OpenVoiceInstant voice cloning by MIT and MyShell. Audio foundation model.项目地址: https://gitcode.com/GitHub_Trending/op/OpenVoice创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表