尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

Edge TTS 教程:免 API 密钥用微软在线文本转语音生成上百种高质量声音

Edge TTS 教程:免 API 密钥用微软在线文本转语音生成上百种高质量声音 Edge TTS 教程免 API 密钥用微软在线文本转语音生成上百种高质量声音【免费下载链接】edge-ttsUse Microsoft Edges online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key项目地址: https://gitcode.com/GitHub_Trending/ed/edge-tts想给应用加上文本转语音不必训练本地模型也不用申请商业 API 密钥。Edge TTSedge-tts是一个直接调用微软 Edge 在线文本转语音服务的 Python 工具装好之后一条命令就能生成语音文件在 Linux、macOS、Windows 上都能使用。项目定位给任意 Python 应用配一支免费声音edge-tts 是一个开源 Python 库它通过逆向工程直连微软 Edge 朗读功能背后的合成服务解决的问题是开发者如何在任意操作系统上免费用上高质量的神经语音合成。它同时提供三个入口——edge-tts命令行、edge-playback即时播放命令以及可导入的 Python 模块内置语音覆盖上百种多语言口音。 为什么能白嫖直连在线服务而非本地模型大多数免费语音合成库要本地跑模型受机器性能制约商业 API 则要申请密钥并按量计费。Edge TTS 走了第三条路src/edge_tts/communicate.py 里的代码模拟了 Edge 浏览器使用的 WebSocket 协议把你的文本封装成标准 SSML含语速、音量、音调等 prosody 参数发送到微软的合成端点服务端实时返回 48 kbps 的 MP3 音频。也就是说你拿到的是微软生产级的神经语音质量而本地零算力开销无需注册账号、无需密钥、不产生费用。它的全部依赖在 src/edge_tts/constants.py 中可见服务的 WebSocket 地址和一个固定的客户端令牌没有任何自己的计费体系。 一条命令生成第一句语音先安装pip install edge-tts再用一条命令生成 MP3并顺带产出 SRT 字幕文件edge-tts --text 你好我是由微软语音合成生成的 --write-media hello.mp3 --write-subtitles hello.srt用edge-tts --list-voices查看全部可用语音用--voice指定例如zh-CN-XiaoxiaoNeural。如果只想马上听效果edge-playback --text ...会直接播放非 Windows 平台需先安装 mpv 播放器。 作为 Python 模块集成到项目import edge_tts communicate edge_tts.Communicate(Hello, world!, en-GB-SoniaNeural) communicate.save_sync(hello.mp3)第一个参数是文本第二个是语音名默认en-US-EmmaMultilingualNeural异步项目可以改用save()或调用stream_sync()拿到音频分块边收边写。examples/ 目录下的六个示例脚本覆盖了同步生成、异步流式、动态选声等用法例如 async_audio_gen_with_dynamic_voice_selection.py 演示了用VoicesManager按性别和语言筛选语音。⚙️ 进阶参数调节语速、音调、音量与字幕edge-tts --rate-20% --pitch-10Hz --volume0% --text 慢一点低音一点 --write-media slow.mp3--rate、--pitch、--volume分别按百分比和赫兹增减负值必须写成--rate-20%的形式。字幕生成是同步进行的服务端返回词句边界元数据库内的SubMaker将其转换为 SRT命令行用--write-subtitles写出Python 端则按 examples 中的流式示例把边界数据喂给SubMaker即可。 三个能直接落地的场景在线教育内容制作把讲义文本批量转成 MP3 加 SRT--file支持从文件读入长文本--write-subtitles同步生成字幕学生边听边看比纯音频更友好。无障碍阅读给网页或文章页加朗读按钮后端调用 Python 模块按用户选定的语音生成音频就能免费为视障用户提供朗读能力。聊天机器人与助手语音用stream_sync()边合成边返回第一块音频用户不用等整段文本合完才听到声音长文本会按 4 KB 自动分片发送首句到达得很快。高频疑问Q需要联网吗A需要每次合成都要连接微软的在线服务没有离线模式。Q支持哪些音频格式A服务直接输出 24 kHz、48 kbps 单声道 MP3--write-media写出的就是这个文件浏览器和播放器都能直接用。Q有没有使用限制A库本身遵循 GPL-3.0 免费开源但它依赖微软的在线服务服务策略变化或频率限制都可能影响稳定性不建议用于高频商业调用。Q有中文语音吗A有用edge-tts --list-voices筛选zh-前缀的语音即可晓晓、云扬等都在列表里。动手开始先在本地跑一遍edge-tts --list-voices挑几个候选语音再用模块那两行 Python 代码把它接进项目更多细节可参考 README.md。【免费下载链接】edge-ttsUse Microsoft Edges online text-to-speech service from Python WITHOUT needing Microsoft Edge or Windows or an API key项目地址: https://gitcode.com/GitHub_Trending/ed/edge-tts创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表