尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

ChatTTS-ui 音色配置速查:4 组社区参数直接抄作业

ChatTTS-ui 音色配置速查:4 组社区参数直接抄作业 ChatTTS-ui 音色配置速查4 组社区参数直接抄作业【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui做音频时最磨人的往往不是合成本身而是挑不出一个顺耳的声音这个太平、那个太演参数一改同一段话像换了一个人。用着 ChatTTS-ui 的话这篇音色配置文章能帮你省下大量试错时间——社区已经把经过耳朵验证的四套配置摆在你面前覆盖新闻播报、情感朗读、儿童故事和客服导航四个场景0.96 版本直接可用。 10 秒速查按场景选音色先看表锁定目标再往下读细节场景种子值temperaturetop_ptop_k一句话人设新闻播报19830.10.70120端正稳重有权威感情感朗读78690.30.8530温暖细腻会传情儿童故事33330.40.6515轻快活泼孩子爱听客服导航44440.20.7525清晰干脆不拖泥带水 场景深读每个音色为什么这么调先交代一句常识种子值决定底层的嗓音temperature 可以理解成声音的发挥空间越低越稳top_p 和 top_k 决定采样的开放程度越大越有变化。下面四组参数都是顺着这条思路调出来的全部来自社区用户的实测。新闻播报 · 种子 1983适合新闻资讯、正式公告。这个嗓音本身就有正襟危坐的权威感所以 temperature 压到 0.1发挥空间几乎锁死字怎么念就怎么念情绪不会自己跑偏top_p 0.701 配 top_k 20 只是留了条底线避免念稿念成单调的机器人。试听083806_use14.39s-audio0s-seed1983.pt-te0.1-tp0.701-tk20-textlen5-39593-merge.wav情感朗读 · 种子 7869拿来读小说、讲情感故事。这个嗓音偏暖temperature 提到 0.3让语调有起伏长段落才不会一听到底top_p 0.85、top_k 30 把采样空间再放开一档情绪类内容宁可让声音飘一点也别僵在原地。试听083910_use3.22s-audio0s-seed7869.pt-te0.1-tp0.701-tk20-textlen5-19801-merge.wav儿童故事 · 种子 3333面向儿童教育内容。这组参数是情绪放开、准确度收紧temperature 0.4 略高讲起来更有劲、不催眠但 top_p 压回 0.65、top_k 收到 15保证每个字音不跑调孩子听得明白。试听083955_use2.84s-audio0s-seed3333.pt-te0.1-tp0.701-tk20-textlen5-93133-merge.wav客服导航 · 种子 4444用在 IVR 语音导航。客服声音要的是又快又清楚不需要个性所以种子 4444 只给 0.2 的 temperature稳定优先top_p 0.75、top_k 25 卡在中间既不木讷也不跳戏。试听084518_use3.15s-audio0s-seed4444.pt-te0.1-tp0.701-tk20-textlen5-77649-merge.wav 拿到音色的两条路子路子一种子值直接生成。在 API 请求里给 custom_voice 填一个正整数比如 custom_voice1234服务端就按这个种子值产出对应嗓音拿不准哪个好听就在网页界面里多试几个数字成本几乎为零。路子二转换外部 PT 音色文件。0.96 版之后内核升级外面下载的旧 PT 不能直接用了先在项目根目录跑一遍转换脚本python cover-pt.py # 转换speaker目录下的seed_*_emb.pt文件它会扫一遍 speaker/ 目录把 seed_ 开头、_emb.pt 结尾的文件重新编码产物留在原处结尾变成 -covert.pt。规则记牢原文件删掉只留 -covert.pt 那个说明见 cover-pt.py 第 18 行。⚡ 批量生成不同音色的 API 写法参数组合定下来之后把清单丢给接口循环跑就行import requests def gen(text, seed, te, tp, tk): res requests.post(http://127.0.0.1:9966/tts, data{ text: text, custom_voice: seed, temperature: te, top_p: tp, top_k: tk, }) return res.json() jobs [(1983, 0.1, 0.701, 20), (7869, 0.3, 0.85, 30), (3333, 0.4, 0.65, 15), (4444, 0.2, 0.75, 25)] for seed, te, tp, tk in jobs: r gen(批量合成测试文本, seed, te, tp, tk) print(r[audio_files][0][url])跑完一轮返回里 audio_files 就是一条条可下载的音频地址每个音色一份方便横向对比。 避坑诊断3 个常见症状症状一音色不生效放了音色文件合成出来却还是老嗓音。 原因原文件和转换后文件同时存在程序加载了错的那份或者文件压根没转换过。 解法删掉原始 PT只保留 -covert.pt 结尾的文件。症状二参数不知道往哪调声音时而是木头时而又飘找不到平衡点。 原因没分清每个参数的分工。 解法温度参数区间 0.1~0.8越高音色变化越大Top-P 区间 0.5~0.9管采样多样性。先动温度找方向再用 Top-P 微调。症状三音色文件单独放上去就用不了加载报错合成直接失败。 原因音色文件只是完整模型的一部分缺了主体它自己不会说话。 解法按 asset/模型下载说明.txt 把完整模型补齐再试。✅ 顺手提一句贡献入口你自己调出好听的种子值加参数组合也可以把 PT 转换好放进 speaker/ 目录音频按 seed-{种子值}-te{温度}-tp{top_p}-tk{top_k}.wav 的格式命名提个 PR 就行合并后署名会出现在 README.md 的贡献者名单里。先从上面的速查表挑一个场景跑一遍再按自己的内容慢慢调吧。【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表