尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Pocket TTS内置声音目录全解析:25种voice的来源、语言与许可清单

Pocket TTS内置声音目录全解析:25种voice的来源、语言与许可清单 Pocket TTS内置声音目录全解析25种voice的来源、语言与许可清单【免费下载链接】pocket-ttsA TTS that fits in your CPU (and pocket)项目地址: https://gitcode.com/GitHub_Trending/po/pocket-ttsPocket TTS 是 Kyutai 开源的轻量级CPU 文本转语音TTS引擎pip install pocket-tts即可把文字变成 24kHz 音频无需 GPU。它的一大卖点就是内置声音目录26 个预置 voice21 个英语 5 个多语言覆盖英语、法语、德语、意大利语、西班牙语、葡萄牙语——只需在命令行敲一个--voice 名字无需下载任何音频文件。本文将带你逐条拆解这些内置声音的来源数据集、语言归属与许可要点并给出一份选声音 试听的速查清单。️ 为什么新手要优先认识内置声音零配置内置声音是官方预计算好的声音嵌入--voice alba即拿即用不用自己准备录音速度快预置声音直接加载 safetensors 嵌入跳过了对音频文件的实时处理加载比现场克隆快得多语言全覆盖6 种语言各自配有母语感更强的默认声音切换语言时自动匹配。 内置声音从哪里来名字背后的映射机制你在命令行输入的每一个声音名字都在 pocket_tts/utils/utils.py 的_ORIGINS_OF_PREDEFINED_VOICES字典里有一条映射指向它背后的原始音频文件VCTK 语料、Common Voice、社区捐赠录音等。加载时pocket_tts/models/tts_model.py 会优先调用get_predefined_voice()直接读取预计算的嵌入文件省去解码音频的开销。下图展示了声音条件audio conditioning如何进入模型左侧的音频条件潜变量就是内置声音发挥作用的位置——它和文本潜变量一起引导自回归模型生成整段语音。 小提示如果你用--config加载社区自训模型预置声音名不可用它们是基于官方权重的嵌入此时会回退到 alba 的原始音频文件任何模型都能克隆。规则定义见 pocket_tts/default_parameters.py。 26 个内置声音完整清单来源 × 语言 × 许可英语声音21 个声音名来源数据集说明albaalba-mackenna/官方录音英语默认声音休闲风格annaverafantinecharlespauleponineazelmageorgemaryjanemichaeleve共 12 个VCTK 语料库p228–p361 增强版12 位不同说话人音色差异明显bill_boerstpeter_yearsleystuart_bellcaro_davy共 4 个Voice Zero 数据集4 位英国说话人cosetteExpresso 数据集带困惑情绪的富表现力录音javertmariusvoice-donations/ 社区捐赠录音Butter.wav / Selfie.wavjeanEARS 语料p010 自由说话增强版自由对话风格 彩蛋Fantine、Cosette、Eponine、Javert、Marius……这些名字大多出自《悲惨世界》官方给声音起名颇有趣味。多语言声音5 个声音名语言来源数据集说明giovanni 意大利语Mozilla Common Voice意大利语意大利语默认声音lola 西班牙语Mozilla Common Voice西班牙语西班牙语默认声音juergen 德语Mozilla Common Voice德语德语默认声音rafael 葡萄牙语Mozilla Common Voice葡萄牙语葡萄牙语默认声音estelle 法语unmute-prod-website/官网录音法语默认声音许可要点速览VCTK仅限非商业研究用途商用前请自行评估Common VoiceMozilla 众包语料采用 CC0 公共许可最宽松官方录音 / 社区捐赠alba-mackenna、voice-zero、voice-donations、unmute 等逐条许可以官方声音仓库页的说明为准README.md 中有入口指引。通用红线Pocket TTS 明确禁止未经同意的声音仿冒、生成虚假信息或冒充真人录音商用请遵守 README.md 中的 Prohibited use 条款。 语言 × 默认声音对照表运行generate/serve时--language决定模型与默认声音的匹配规则见 pocket_tts/default_parameters.py语言--language参数默认声音备注英语english默认alba另有english_2026-01等版本法语frenchestelle支持french_24l高质量版德语germanjuergen支持german_24l意大利语italiangiovanni支持italian_24l葡萄牙语portugueserafael支持portuguese_24l西班牙语spanishlola支持spanish_24l⚡ 24l 变体是 24 层大模型音质更高但速度更慢适合离线批量生成。⚡ 3 步上手快速试听全部内置声音第 1 步安装Linux 用户建议走 CPU-only 安装避免下载数 GB 的 CUDA 依赖pip install pocket-tts --extra-index-url https://download.pytorch.org/whl/cpu也可以直接克隆源码仓库浏览声音映射与文档git clone https://gitcode.com/GitHub_Trending/po/pocket-tts第 2 步命令行切换声音pocket-tts generate --voice jane --text Hello, this is Jane speaking.第 3 步Web 界面批量试听运行pocket-tts serve后打开http://localhost:8000网页下拉框里就是全部 26 个内置声音列表定义见 pocket_tts/static/index.html模型常驻内存切换试听比命令行快得多。 延伸资料与关键文件docs/CLI Commands/generate.md--voice参数的完整选项与输出格式24kHz / 单声道 / 16-bitdocs/CLI Commands/serve.md本地 Web 服务部署细节docs/CLI Commands/export_voice.md把任意音频导出为 safetensors 嵌入实现自己的声音秒加载docs/API Reference/python-api.mdget_state_for_audio_prompt()等 Python API 用法pocket_tts/utils/utils.py26 个内置声音的源头映射表本文清单的原始出处一句话总结Pocket TTS 的内置声音目录 21 个英语 5 个多语言预置声音名字即入口、语言即默认、许可需留意——掌握这份清单你的 CPU 级 TTS 语音方案就齐了 【免费下载链接】pocket-ttsA TTS that fits in your CPU (and pocket)项目地址: https://gitcode.com/GitHub_Trending/po/pocket-tts创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表