尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

# WorkBuddy 接入 TTS 语音合成实战:7 款 AI 配音技能包安装与使用教程(附截图)

# WorkBuddy 接入 TTS 语音合成实战:7 款 AI 配音技能包安装与使用教程(附截图) 本文实测环境Windows 11 WorkBuddy 最新版 Python 3.14涵盖 IndexTTS2.5、OmniVoice、FishAudio、GPT-SoVITS、Noiz、NiceVoice、Lipvoice 共 7 款 TTS 引擎一、先说结论WorkBuddy 安装 TTS 技能包后可以直接用自然语言完成语音合成和声音克隆你用 IndexTTS2.5 合成这句话今天天气真好我们一起出去玩吧 你帮我上传这个音频创建一个声音模型名字叫我的声音 你把这个 txt 里的 30 条文案全部合成用带货音色情绪选开心全程零代码、免本地部署、不吃显卡——推理在云端完成核显轻薄本也能跑。二、原理技能包是怎么工作的WorkBuddy 支持安装技能Skill可以理解为插件。TTS 技能包内部封装了语音合成平台的 REST API 调用逻辑执行流程是解析你的自然语言指令合成文本、音色、情绪、语速携带环境变量中的 API Key 请求云端推理服务合成完成后把音频文件下载到本地工作目录直接在对话中发给你技能包目录结构很简单就是一个 SKILL.md 加一个 scripts 文件夹skills/ └── indextts2-tts/ ├── SKILL.md # 技能描述与调用规则 └── scripts/ └── tts.py # API 调用脚本三、7 款技能包选型对照表7 款技能包在同一个下载页分发见下一节底层模型和适用场景各不相同技能包底层模型最擅长的场景情绪控制语速IndexTTSB站开源 IndexTTS2.5影视级克隆、22种方言、中英日西阿五语种8种0.5x-1.5xOmniVoice小米开源 OmniVoice 0.8B600语种出海内容、长文本8种0.5x-1.5xFishAudioFish Speech S2多语言朗读、共享音色库支持0.5x-1.5xGPT-SoVITSGPT-SoVITS 开源5秒样本快速克隆、老牌稳定8种0.5x-1.5xNoiz云端聚合引擎大批量并发合成6种0.5x-1.5xNiceVoice超拟人引擎短剧、带货、广告配音9种0.5x-1.5xLipvoice云端低延迟引擎实时直播、超长文本8种0.5x-1.5x追新求质感IndexTTS 技能包已支持 2.5 版本相比 2.0 推理速度提升一倍多音色与情绪解耦参考音频不用带情绪录喜怒哀乐后期单独调做出海/小语种OmniVoice600 语种基本独一份短剧带货NiceVoice9 种情绪含吐槽、撒娇、广告腔戏剧张力最足矩阵号批量跑量Noiz并发稳或 Lipvoice延迟低、超长文本不吞字。不用纠结7 个全装上也就几分钟按需切换。四、安装步骤全程截图第一步确认 Python 环境技能脚本依赖 Python 3.6。按Win R输入cmd回车执行py--version显示版本号即可下图为 Python 3.14.0如果提示不是内部或外部命令去 python.org 下载 Windows 安装包安装时务必勾选 Add Python to PATH装完重开 cmd 再验证。第二步下载并安装技能包打开技能包下载页腾讯云 CodeBuddy 托管页面上 7 款技能包各自有独立的 zip 下载按钮以 IndexTTS 为例方式 A一键安装推荐下载 zip 后在 WorkBuddy 对话框输入/install-skill在弹出窗口中选择导入 ZIP 文件选中刚下载的 zip 即可。方式 B手动安装一键安装失败时用解压 zip把文件夹放到技能目录C:\Users\你的用户名\.workbuddy\skills\放好后的结构如下注意是 SKILL.md scripts 文件夹在同一层重启 WorkBuddy技能会被自动识别。第三步配置 API KeyAPI Key 在各站点开通会员后联系客服获取以 IndexTTS 为例在开通会员后获取是一串 32 位左右的字符串。方式 A对话内输入最省事第一次使用技能时WorkBuddy 会自动提示你提供 Key、配音文本和音色偏好把 Key 直接贴进去即可一次配置永久生效方式 B环境变量推荐一劳永逸右键此电脑 → 属性 → 高级系统设置 → 环境变量在用户变量里新建7 款技能包对应的变量名技能包环境变量名IndexTTSINDEXTTS2_API_KEYOmniVoiceOMNIVOICE_API_KEYFishAudioFISHAUDIO_API_KEYGPT-SoVITSGPTSOVITS_API_KEYNoizNOIZ_API_KEYNiceVoiceNICEVOICE_API_KEYLipvoiceLIPVOICE_API_KEY配置完重启 WorkBuddy/终端才生效。Key 等于账户额度切勿截图外传。第四步开始使用直接在对话框下自然语言指令即可。下图是上传一段干声 wav、让它克隆声音并合成一段配音的实际效果——2 秒完成音频产物直接在对话里给出常用指令示例用 IndexTTS2.5 合成今天天气真好我们一起出去玩吧 帮我上传这个音频创建声音模型名字叫我的声音 列出我所有的声音模型 把这个 txt 里的 30 条文案全部合成用我的声音情绪开心语速 1.2 倍五、成本对比以每天一条 10 分钟口播、一年 365 条为基准方案年成本附加成本本地部署RTX3060 级别2500 元起硬件折旧电费3-5 天部署时间租云 GPU中端 A10 实例约 14000 元随用随开也要 40 元/天API 技能包方案专业版年卡 199 元起一条 10 分钟口播约 0.4 元零维护API 方案另一个隐性优势模型大版本更新如 2.0 升 2.5服务端直接升级技能包同步更新即可用不用重新配环境。六、常见问题Q1提示找不到 Python / py 不是内部命令安装时没勾 Add Python to PATH重装勾上或手动把 Python 安装目录加入环境变量 Path重开 cmd。Q2Key 配了还是报无权限环境变量配置后必须重启 WorkBuddy方式 A 对话内输入的 Key 不受此影响。Q3合成的音频在哪默认保存在脚本运行的工作目录最省事的方式是直接对 WorkBuddy 说把刚生成的音频发给我。Q4想先试听再决定开会员各站网页端都支持在线试音新用户有 0.01 元体验包约 12 万字符可合成300 分钟音频。Q5有编程需求想绕过技能包直接调 API技能包本质是 REST API 的封装各站开发者板块提供完整接口文档含音色列表查询、批量合成、回调等企业会员可直接接入自己的业务系统。可以在这里体验indextts.xin/?srcpcs915。也可以看我主页安装过程有问题的欢迎评论区留言看到都会回。觉得有用点个赞收藏免得下次找不到。
返回列表