尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

WhisperLiveKit 说话人区分实战指南:如何从安装到调参实现实时多人转录

WhisperLiveKit 说话人区分实战指南:如何从安装到调参实现实时多人转录 WhisperLiveKit 说话人区分实战指南如何从安装到调参实现实时多人转录【免费下载链接】WhisperLiveKitReal-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.项目地址: https://gitcode.com/GitHub_Trending/wh/WhisperLiveKit开多人会议做笔记时转录出来的文字常常分不清是谁说的只能回头听录音逐句归位。WhisperLiveKit 的 Sortformer 说话人区分功能可以在实时转录音频的同时自动给每句话标上说话人编号让多人会议的实时转录和字幕带上可用的谁说了什么信息。理解这项功能实时说话人区分WhisperLiveKit 的说话人区分与 ASR 转录并行运行音频流一边做语音检测与转录一边由 Sortformer 模型输出谁在说话的片段再与转录文本对齐。你拿到的不只是一段字而是带编号的发言。它适合两到四人同时交谈的场景多人会议记录、访谈转写、直播字幕。默认模型支持 4 个说话人覆盖多数办公场景。与先录音、后处理的传统方式相比差别主要体现在出结果的时间和占用上方面WhisperLiveKit 流式区分传统离线处理出结果时间边说边出等录音结束内存占用只保留定长说话人特征缓存需存完整音频说话人身份会话内持续更新每次离线重识别原理通俗版双缓存流式推理Sortformer 把音频流切成约 1 秒的块逐块顺序处理而不是整句听完再归人。每处理一块它会更新两块缓存spkcache存会话开始以来的说话人特征相当于长期记忆保证张三还是张三fifo存最近几个块的特征相当于短期记忆负责跟上近期变化。每块处理完模型对每个说话人通道按帧输出概率默认最多 4 个通道连续属于同一人的帧被合并成带起止时间的说话人片段再对齐到转录文本上。# 示意流程非真实源码 features audio_to_mel(pcm_chunk) # 音频块转梅尔频谱 state, preds model.forward_streaming_step( features, state, left_offset, right_offset) # state 内含 spkcache长期与 fifo短期两块缓存 segments merge_consecutive_frames(preds) # 帧预测合并为带时间戳片段如何快速跑起来一条命令安装并开启说话人区分# 安装基础包与 Sortformer 依赖支持 Python 3.11–3.13 pip install whisperlivekit[diarization-sortformer] # 启动带说话人区分的服务 wlk --model base --diarization如果用 Docker执行docker compose up --build wlk-gpu-sortformer即可拉起预配置的 GPU 配置。启动后打开 http://localhost:8000 开口说话页面会显示带说话人编号的实时转录Speaker 1 00:00–00:04 先确认一下本季度的目标 Speaker 2 00:04–00:09 数据这边初版结果已经出来了实战参数怎么调说话人数量与实时延迟--sortformer-max-speakers声明本次会话最多几个说话人1–4默认 4。模型按出现顺序保留前 N 个通道。一对一访谈设 2可避免空通道干扰归因。--min-chunk-size每次处理前的最小音频缓冲默认 0.1 秒。值越小转录反馈越快机器跟不上时适当调大。--pause-segmentation-seconds停顿超过该秒数就形成一个稳定转录段默认 5.0。发言切换频繁想更快落段就调小长会议想句子更完整就调大。另外--sortformer-model-path可以直接指向本地的 .nemo 模型文件或模型目录覆盖默认模型省掉启动时的下载。进阶玩法多语言、实时翻译与 API 集成多语言会议wlk --model large-v3 --diarization --language auto模型自动判断语言说话人标签保持不变。实时翻译wlk --model large-v3 --diarization --target-language en非英语会议边转边出英文说话人编号保留。API 集成原生 WebSocket 地址为ws://localhost:8000/asr返回的片段带speaker字段-2 表示静音同时提供 OpenAI 兼容 REST 接口需以--diarization启动。这套组合适合多人会议记录、访谈转写和直播字幕场景默认 4 人模型在多数情况下够用双缓存的实现可以看 whisperlivekit/diarization/sortformer_backend.py完整参数与接口说明见 docs/configuration.md 和 docs/API.md。【免费下载链接】WhisperLiveKitReal-time, local speech-to-text with streaming ASR, speaker diarization, translation, and OpenAI/Deepgram-compatible APIs.项目地址: https://gitcode.com/GitHub_Trending/wh/WhisperLiveKit创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表