尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

在 Windows 上本地跑 FunASR 离线语音转写:无需 GPU 的部署实践指南

在 Windows 上本地跑 FunASR 离线语音转写:无需 GPU 的部署实践指南 在 Windows 上本地跑 FunASR 离线语音转写无需 GPU 的部署实践指南【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR用 FunASR 本地部署方案你可以在自己的 Windows 机器上跑起一套离线语音转写服务音频全程不出内网。本文带你完成三件事三步启动 Windows 离线识别服务、用三种方式发起转写以及查表完成调优与排障。本地部署到底解决什么问题先看两个典型场景会议录音转写一场 2 小时的部门例会录音如果走云端 API长音频要整体上传网络抖动时任务直接中断本地跑 FunASR 离线语音转写服务文件读进来、文本落出去链路完全在机房或办公室内闭环。客服语音质检合规要求通话录音不能离开企业边界而自建 CPU 转写集群在 16 核机器上实测可支撑 64 路并发RTFReal-Time Factor实时率低至 0.0076——换算一下转写 1 小时音频约需 27 秒质检批处理不再是瓶颈。多格式素材直接处理转写对象不限于 wavmp3、mp4 这类音视频文件也可以直接喂给服务省掉前置转码环节。一句话背景FunASRFundamental End-to-End Speech Recognition Toolkit是达摩院语音实验室开源的端到端语音识别工具包覆盖 ASR自动语音识别、VAD语音活动检测、PUNC标点恢复全链路其 Windows SDK 2.0 版在纯 CPU 环境即可提供中文/英文离线文件转写与实时转写服务无需 GPU这正是企业本地化部署最在意的两点。最短路径启动离线转写服务部署前的依赖要求可以压缩成一张清单依赖项要求操作系统Windows 10/11 专业版64 位运行时.NET Framework 4.8 及以上容器环境Docker Desktop for WindowsWSL2 后端版本工具Git for Windows家庭版系统需先启用 WSL2 功能可按微软官方文档操作。确认清单无误后按三步走第 1 步获取代码git clone https://gitcode.com/GitHub_Trending/fun/FunASR cd FunASR/runtime/deploy_tools第 2 步执行部署脚本进入runtime/deploy_tools目录双击funasr-runtime-deploy-offline-cpu-zh.bat按提示完成三项配置选择模型类型1基础转写 / 2带时间戳 / 3热词增强、确认服务端口默认 10095、指定工作目录建议放 D 盘避免权限问题。若脚本报docker: command not found说明 Docker Desktop 尚未装好安装后重启电脑再试。第 3 步验证成功浏览器访问http://localhost:10095出现服务状态页即部署成功也可在命令行确认健康检查curl http://localhost:10095/health # 预期返回{status:healthy,version:2.0}日常运维用同一个批处理脚本管理启动funasr-runtime-deploy-offline-cpu-zh.bat start停止... stop重启... restart替换模型则用... update --asr_model 模型ID。离线转写能力拆解服务起来之后有发起转写的三种入口按你的工作流对号入座用法适用场景关键参数单文件转写Python 客户端临时转写一条会议录音、访谈音频--audio_in本地路径mp3/mp4 等均可网络文件加http://前缀--use_itn 1开启 ITN逆文本规范化把一二三规范成123--hotword指定热词文件每行格式为热词 权重如阿里巴巴 20批量转写wav.scp 列表模式整目录归档、定期批量出文本--audio_in指向 wav.scp 文件每行一条文件名 路径--output_dir指定文本输出目录网页端可视化界面不想装客户端随手转一条或用麦克风实时转直接打开runtime/html5/static/index.html浏览器里上传文件或开麦转写客户端调用只需一条命令以单文件为例python runtime/python/websocket/funasr_wss_client.py --host 127.0.0.1 --port 10095 \ --mode offline --audio_in C:/meeting_recording.wav --use_itn 1批量模式把--audio_in换成 wav.scp 路径、追加--output_dir C:/transcripts即可wav.scp 内容形如meeting1 C:/audio/meeting1.mp3 meeting2 C:/audio/meeting2.wav调优旋钮并发与长音频参数表服务默认参数能满足多数场景遇到并发不够或超长音频时调下面四个旋钮即可无需改代码参数推荐值作用--decode_thread_num8约为 CPU 核心数 ÷ 2解码线程数直接决定并发处理能力--io_thread_num4约为 CPU 核心数 ÷ 4IO 线程数负责音频文件读写--max_single_audio_length3600单位秒限制单条音频最大时长超长音频1 小时走分片处理模式--asr_model领域模型 ID替换默认 ASR 模型例如医疗场景换damo/speech_paraformer-large_asr_nat-zh-cn-16k-medical-vocab5000-pytorch通用场景换damo/speech_paraformer-large_asr_nat-zh-cn-16k-common-vocab8404-pytorch下发方式统一走服务的 update 子命令例如funasr-runtime-deploy-offline-cpu-zh.bat update --decode_thread_num 8 --io_thread_num 4换模型同理funasr-runtime-deploy-offline-cpu-zh.bat update --asr_model 模型ID。故障诊断现象常见原因处理动作容器启动即退出日志出现 port is already allocated10095 端口已被其他进程占用执行netstat -ano \| findstr :10095找到 PID再用taskkill /PID 进程ID /F释放端口后重新启动转写准确率偏低通用模型缺少行业术语、音频采样率不统一三步走把模型升级到 model_zoo/modelscope_models.md 中的最新版本在workspace/hotwords.txt里补充行业热词后重启服务用 Audacity 把音频统一重采样为 16kHz同网段其他机器访问不了服务Windows 防火墙拦截了入站 10095执行netsh advfirewall firewall add rule nameFunASR dirin actionallow protocolTCP localport10095 remoteiplocalsubnet profileany放行端口脚本运行报docker: command not foundDocker Desktop 未安装或未重启安装 Docker Desktop for WindowsWSL2 后端并重启电脑硬件选型与适用场景离线识别服务是纯 CPU 方案机器怎么买取决于你预期的并发量对照实测数据按档选择档位CPU内存并发能力适合谁基础版4 核8GB32 路个人、小团队的内部工具机标准版16 核32GB64 路部门级应用如客服质检批量任务企业版64 核128GB200 路大规模集群部署决策路径很简单先估算峰值并发同时在转写的音频路数落在 32 路以内选基础版即可需要稳定压满 64 路就上一台 16 核 32GB 的标准版——这也是官方性能报告里 RTF 0.0076 的实测机型档位跨部门共享、并发逼近 200 路再考虑企业版或水平扩容多节点。更多不同 CPU 平台下的吞吐数据可查 runtime/docs/benchmark_onnx_cpp.md。资源索引官方文档入口docs/official.md项目教程与安装说明README.md可部署模型列表model_zoo/modelscope_models.mdCPU 性能测试报告runtime/docs/benchmark_onnx_cpp.md离线 SDK 进阶指南runtime/docs/SDK_advanced_guide_offline.md社区支持钉钉交流群见 docs/images/dingding.jpg 中的群二维码或直接向项目仓库提交 Issue【免费下载链接】FunASROpen-source speech recognition toolkit for training, inference, streaming ASR, VAD, punctuation, speaker diarization pipelines, and OpenAI-compatible/MCP serving.项目地址: https://gitcode.com/GitHub_Trending/fun/FunASR创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表