尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

ChatTTS-ui 本地文字转语音网页界面:免费把文字合成自然语音

ChatTTS-ui 本地文字转语音网页界面:免费把文字合成自然语音 ChatTTS-ui 本地文字转语音网页界面免费把文字合成自然语音【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-uiChatTTS-ui 是一个本地文字转语音的网页界面用浏览器输入文字即可离线合成中文或中英混杂的语音支持 Docker、源码两种部署方式还对外提供 TTS API 接口适合需要离线配音的内容创作者和想集成语音合成功能的开发者。 本地文字转语音工具能替你解决什么问题ChatTTS-ui 把 ChatTTS 语音合成模型一个能输出接近真人音色的开源模型装进了一个浏览器网页里输入文字、选个音色、点击按钮就得到 wav 音频全程数据不离开本机。它解决的核心痛点是不想把文本发给第三方接口、也不想按量付费同时希望界面简单到不需要写代码。除了网页操作服务启动后还自带/tts接口方便其他程序调用。 跑起 TTS 服务的三种方式从最快到最灵活推荐路线是Windows 预打包版全程无需配置环境Linux 服务器建议用 Docker需要深度定制改依赖、换设备再走源码部署。路线一Windows 预打包版3 步跑通从项目 Releases 下载压缩包解压后双击app.exe首次启动会自动检测网络并下载模型可连 huggingface.co 则从那里下否则自动改从阿里魔塔 modelscope 下载浏览器自动打开默认地址http://127.0.0.1:9966前置条件Windows 环境即可若英伟达显卡显存大于 4G 且已装 CUDA 12.8会自动启用 GPU 加速。部分安全软件可能误报遇到时改走源码部署。路线二Docker 容器化部署Linux 服务器前置条件已安装 Docker 与 docker compose。git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui.git cd ChatTTS-ui # GPU 版本 docker compose -f docker-compose.gpu.yaml up -d # CPU 版本 docker compose -f docker-compose.cpu.yaml up -d启动后访问部署机器的IP:9966即可本机可用http://127.0.0.1:9966。路线三源码部署Linux / macOS / Windows前置条件Python 3.9–3.11 环境。git clone https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui.git cd ChatTTS-ui python3 -m venv venv source ./venv/bin/activate pip3 install -r requirements.txt # 无 CUDA 加速 pip3 install torch2.7.1 torchaudio2.7.1 # 需要 CUDA 加速另需 CUDA 12.8 ToolKit pip install torch2.7.1 torchaudio2.7.1 --index-url https://download.pytorch.org/whl/cu128 python3 app.py注意模型默认从 modelscope 下载下载过程中必须关闭代理否则会报 proxy 错误。️ 从基础合成到自定义音色界面操作走读单一功能——基础合成。在文本框输入文字按行分段合成从音色下拉框选一个预设音色点击立即合成声音下方即出现可播放的音频。中英文、数字、符号混杂的文本可以直接输入无需额外处理。功能组合——合成 控制符 种子音色。在 Prompt 输入框填写控制词例如[laugh_0]加笑声、[break_6]插入停顿、[oral_2]让表达更口语化同时在音色值填入一个大于 1 的种子数字如 3000即可得到一个不同于预设的随机音色生成结果会保存到本地 speaker 目录。想要长期稳定复用某个音色可以把 csv 或 pt 格式的音色文件放进 speaker/ 目录作为固定音色。需要说明的是相同种子值在不同设备上、甚至同一设备多次生成音色都可能不同追求稳定就用固定音色文件。高级设置——参数与 API。界面上还有语速1–9 档、temperature、top_p、top_k 等采样滑杆调节语气随机程度与节奏编辑.env文件可修改WEB_ADDRESS监听地址与端口、device手动指定 cpu / mps / cuda、compile。服务本身就是一个 API向http://127.0.0.1:9966/tts发 POST 请求参数包括text、voice、prompt、temperature、top_p、top_k、skip_refine、custom_voice成功时返回 JSON内含 wav 文件路径和可直接下载的 urlpyVideoTrans 等工具可直接对接。常见报错的处理方法见 faq.md。 这个 TTS 网页界面适合谁用自媒体创作者文案量大、需要频繁出配音时用它批量把稿子转成音频再导入剪辑软件合成视频。开发者想在自研工具里加文字转语音能力又不想维护模型时直接调用/tts接口拿到 wav。个人用户对隐私敏感、不想让文本经过外部服务时在本机离线合成朗读音频。⚠️ 常见报错与对策部署避坑清单现象解决办法下载模型时报ProxyError、proxy 类错误modelscope 不允许走代理下载关闭代理后重试FileNotFoundError缺path.yaml或Missing spk_stat.pt模型文件不完整重新下载模型或单独补齐缺失文件放到models/pzc163/chatTTS对应子目录有英伟达显卡却仍走 CPU或 GPU 上速度很慢确认显存大于 4GCUDA 升级到 11.8并卸载后重装 CUDA 版 torch--index-url .../cu128macOS 进度条卡在 0% 或报 libomp 错误执行brew install libomp必要时把.env中compiletrue改为compilefalse启动报Dynamo is not supported on Python 3.12项目要求 Python 3.9–3.11换用 3.10 重建虚拟环境相同种子值这次和上次音色不一样属已知行为音色会漂移需要稳定音色时改用 csv / pt 固定音色文件ChatTTS-ui 把语音合成模型从要会写代码才能用变成了打开浏览器就能用隐私与成本两个问题也一并落地。后续可关注项目的音色库扩充与多设备兼容优化本地文字转语音的体验还会继续提升。【免费下载链接】ChatTTS-ui一个简单的本地网页界面使用ChatTTS将文字合成为语音同时支持对外提供API接口。A simple native web interface that uses ChatTTS to synthesize text into speech, along with support for external API interfaces.项目地址: https://gitcode.com/GitHub_Trending/ch/ChatTTS-ui创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表