尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

MOSS-TTS-OpenAI 插件实战:打造私有化 TTS API 服务

MOSS-TTS-OpenAI 插件实战:打造私有化 TTS API 服务 MOSS-TTS-OpenAI 插件实战打造私有化 TTS API 服务【免费下载链接】MOSS-TTSAn open-source model family for long-form speech, dialogue synthesis, voice design, sound effects, and real-time streaming TTS项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTSMOSS-TTS 是 MOSI.AI 与 OpenMOSS 团队开源的语音与声音生成模型家族覆盖长文本朗读、多角色对话、声音设计、音效生成和实时流式 TTS 五大场景。本文面向新手手把手教你把它当成一个OpenAI 兼容的 TTS 插件快速搭出一套数据不出内网的私有化 TTS API 服务——支持流式合成与声音克隆语音助手、播客、有声书都能用。 为什么选择 MOSS-TTS 私有化部署商用 TTS API 按量计费、数据要上传公网而 MOSS-TTS 家族完全开源模型权重可下载到自己机房配合推理后端还能暴露OpenAI 风格接口业务代码几乎零改造MOSS-TTS-v1.58B旗舰模型零样本声音克隆、长语音、31 种语言、[pause 3.2s]显式停顿控制MOSS-TTS-Realtime1.7B面向语音 Agent 的实时流式模型TTFB 低至 180msMOSS-TTS-Nano0.1B4 核 CPU 即可实时跑适合边缘与低成本场景MOSS-TTSD / VoiceGenerator / SoundEffect对话合成、声音设计、音效生成 第一步把 MOSS-TTS 接入 OpenAI 生态仓库的 README.md 明确支持两类高吞吐推理后端均提供OpenAI 兼容的/v1/audio/speech端点并支持流式输出与声音克隆推理后端支持的架构覆盖模型SGLang-OmniMossTTSDelay、MossTTSLocalMOSS-TTS、MOSS-TTS-Local-Transformer-v1.5vLLM-OmniMossTTSDelay、MossTTSRealtime、MossTTSNanoMOSS-TTS 全系 Realtime Nano也就是说只要你的项目已经用 OpenAI SDK 写过 TTS 调用把base_url换成自建服务地址、填入本地模型就能无缝切换到 MOSS-TTS这就是OpenAI 插件玩法的核心。⚡ 第二步用 MOSS-TTS-Realtime 搭流式 API 服务如果你要做语音助手这类低延迟场景仓库自带一套现成的 FastAPI 服务核心源码在 moss_tts_realtime/fast_api.py配套演示客户端 moss_tts_realtime/tts_client.py。服务接口一览会话式设计服务默认监听0.0.0.0:8083音频以PCM s16le、24kHz 单声道流式返回采样率可用MOSS_TTS_TARGET_SR调整接口方法作用/healthGET健康检查返回模型路径与设备信息/tts/session/startPOST开启新一轮对话可传prompt_audio做声音克隆/tts/session/pushPOST流式推送文本is_finaltrue表示本轮结束/tts/session/{id}/audioGET持续拉取 PCM 音频流/tts/session/closePOST关闭会话并释放资源这套start → push → audio的会话式设计正好对接上游大模型的流式输出LLM 每吐出一段文字就push一次客户端同时从 audio 端点边收边播实现边想边说。仓库还提供了完整的对接示例 moss_tts_realtime/example_llm_stream_to_tts.py演示了 LLM 流式响应直接喂给 TTS 的完整链路。架构上MOSS-TTS-Realtime 采用1.7B 主干 200M 深度 Transformer的层级设计文本与语音 token 分层处理天然支持流式进出。详细规格可看 moss_tts_realtime/README.md 与模型卡片 docs/moss_tts_realtime_model_card.md。启动服务的最小步骤git clone https://gitcode.com/GitHub_Trending/mo/MOSS-TTS cd MOSS-TTS pip install -e .[torch-runtime] # 启动流式 API需 CUDA 环境模型路径可用环境变量覆盖 python moss_tts_realtime/fast_api.py --host 0.0.0.0 --port 8083 第三步低成本部署与效果验证8GB 显卡也能跑仓库内置 llama.cpp 免 PyTorch 推理链路GGUF 主干 ONNX 音频编解码四套预置配置在 configs/llama_cpp/default.yaml、trt-8gb.yaml、cpu-only.yaml 中低显存模式按阶段加载模型8B 模型可压进 8GB 显卡。纯 CPU 也能实时MOSS-TTS-Nano 仅 0.1B 参数4 核 CPU 即可流式合成还是 48kHz 立体声非常适合内网终端和轻量网关效果不打折MOSS-TTSD 在主观评测中整体胜率超过多家闭源旗舰 TTS开源私有化不等于牺牲音质✅ 小结三步拥有私有 TTS API拉仓库装依赖git clone后pip install -e .[torch-runtime]推荐 Python 3.12 Transformers 5.0.0 的干净环境选推理后端追求 OpenAI 兼容接口用 SGLang-Omni / vLLM-Omni做实时语音 Agent 直接用仓库自带 FastAPI 流式服务 moss_tts_realtime/fast_api.py业务零改造接入OpenAI SDK 换base_url即用声音克隆只需传一段参考音频。想快速上手体验各模型的浏览器 Demo 脚本见 clis/moss_tts_app.py、clis/moss_ttsd_app.py、clis/moss_voice_generator_app.py微调教程按架构组织在 moss_tts_delay/finetuning/、moss_tts_realtime/finetuning/用你自己的声音数据继续打磨这条私有语音链路。【免费下载链接】MOSS-TTSAn open-source model family for long-form speech, dialogue synthesis, voice design, sound effects, and real-time streaming TTS项目地址: https://gitcode.com/GitHub_Trending/mo/MOSS-TTS创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表