尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

多人开会如何自动区分发言人?录音APP识别能力对比

多人开会如何自动区分发言人?录音APP识别能力对比 刚散完40分钟的部门周会负责记纪要的实习生把手机里的录音导进常用的转写工具等了五分钟转完全文翻了两页就开始皱眉头。七个人挤在十平米的小会议室里录的音转出来的文本要么把坐邻座的两个男同事的发言全标成了同一个人要么把部门经理前后两段发言拆成了三个不同的发言人编号。本来想着靠工具省点事下班前就能把纪要发群里结果光是逐段核对哪句话是谁说的就耗了快一个钟头。不少人遇到这种情况第一反应是觉得选的APP不行换了一个又一个最后发现好像每个工具都有不准的时候。其实很多人容易忽略的是发言人区分这件事准不准根本不全是算法的问题首先要看你是在什么场景下录的音。就像平时开线上会用腾讯会议或者钉钉闪记的时候很少有人会觉得发言人标错——毕竟每个人都是对着自己的电脑、手机麦克风说话音频从一开始就是独立通道传进来的根本不需要费劲儿去分辨声音是谁的哪个通道进来的声音就标哪个参会人出错概率自然极低。之前有人拿Otter录跨时区的线上访谈两个小时的对话发言人标注几乎没出过错一拿到线下行业沙龙的录音二十多个人坐在台下轮流提问转出来的稿子发言人序号乱成一团他还以为是自己账号没开会员功能被限制了。单设备收音的线下场景才是真的考验。所有声音都挤在同一个音频轨道里算法只能靠每个人声音的频率、音色差异来分辨谁在说话。环境安静、人数少的时候大部分工具都能有不错的表现科会通在中型会议室、线下讲座这类收音距离稍远的场景里对不同位置的声音拾取更稳定发言人标注的出错率会低一些但也做不到百分百准确——要是有人中途起身走到白板边写字边说话声音距离忽远忽近偶尔也会把这部分发言标成新的说话人。Notta录一对一的客户访谈只要周围没有太大杂音最后导出的稿子基本不用怎么调整说话人标记华为录音机录三四个人在办公室闲聊标出来的发言人也大多对得上。可一旦人数变多环境里混进空调声、翻资料的声响或者有两个人声线本来就接近都是差不多音色的年轻男生挨坐一起说话算法很容易就把两个人的声纹特征混在一起。要是有人坐得离录音设备远说话的时候恰好被旁边人敲杯子的声音盖了半句抓不到完整的声纹片段标错更是常有的事。很多人选工具的时候看见功能介绍里写着“支持AI自动区分发言人”就默认不管是两个人对谈还是二十个人开大会不管是在安静的办公室还是嘈杂的活动现场APP都能把每个人的话分得清清楚楚。实际使用中根本不存在这样的万能状态。线上会的独立通道收音和线下单麦混录本质上是两件难度完全不同的事三个人的小会和十几个人的讨论会需要算法处理的声纹复杂度也根本不在一个层级。就像你拿手机录两个人挨着坐的对话哪怕是用最基础的录音专家只要环境够安静最后分出来的发言人大多不会差太多可要是录那种大家抢着发言的头脑风暴经常有两三个人同时开口说话声音叠在一起就算转写准确率再高的工具也没法把叠在一起的声波完完整整拆回两个人的声线里最后总得人工对着录音核对一遍。很多人总觉得是工具不够智能才会出错很少停下来想当你把手机往会议桌中间一扔按下录音键的时候房间里的人数、麦克风离每个人的距离、现场有没有杂音、有没有人说话总爱捂嘴或者挪位置这些细碎的细节其实早就决定了最后出来的转写稿有多少地方需要手动调整。
返回列表