尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

AI搜索准确率低却日益普及,人类使用需提升“信商”甄别信息

AI搜索准确率低却日益普及,人类使用需提升“信商”甄别信息 AI搜索常见错误频发用户搜黎元洪豆包给出用范伟PS的照片这一AI常见错误竟上了热搜。其实这不是AI第一次干这种“蠢事”也不会是最后一次。此前有小朋友拿老鼠夹问AIAI说是“废弃卡丁车小玩具”导致孩子手指被夹有用户给AI毒蘑菇AI判定为可食用杏鲍菇。遇到这类情况AI都会诚恳道歉。AI翻车与渗透率的关系是豆包越来越傻了吗并非如此。当豆包月活涨到3.45亿时即便错误率恒定随着分母增大分子也会变大翻车案例增多且每次都会引发豆包用户的“共鸣”登上热搜。所以AI翻车段子的数量实则是AI渗透率的反向指标。就像前几年有人说百度地图傻也有人说高德地图笨其实没有谁比谁更聪明用得多了总会遇到导航出错的情况。AI犯错的原因AI搜索骗你是因为互联网骗了AI。此次豆包错将范伟当黎元洪官方回应称与一部电影选角有关范伟和黎元洪长得像其PS图当年被媒体大量报道、全网疯传部分图库和百科页面也曾误收录所以AI检索时优先命中了这些高频传播的错误图片。AI经常犯错的根本原因是互联网本身存在大量错误信息AI检索时容易获取到这些错误内容。这不是“豆包的问题”而是“所有AI的问题”并且AI生成的内容被网友海量发布到网上造成交叉污染。NewsGuard在2025年8月发布的数据显示10款主流AI工具在新闻话题上重复虚假信息的比例是35%而一年前只有18%。GPT - 4.5的生成答案中缺乏依据的主张比例达到了47%Perplexity深度研究工具甚至出现了97.5%的惊人数字。AI搜索准确率现状换言之从统计学原理上看每一个AI搜索答案都包含不可消除的噪声。有朋友认为现在AI搜索99%是对的1%的结果犯傻识别出这1%就能放心使用。但根据Google内部测试数据在4326条样本中Gemini AI概览准确率已达91%虽很高但仍有每10条就错1条的可能。中国AI搜索面临的实际情况更复杂“自媒体平台”做号党的内容创作制度让中文互联网的文本污染尤其严重很多新媒体平台充斥着大量AIGC内容以及AI洗稿伪原创内容。从技术上看考虑到数据质量和大模型技术原理99%的准确率对AI搜索是遥不可及的目标100%的准确率如同“绝对零度”可不断接近但永远无法达到。更何况世界上某些问题本就没有唯一正确答案AI的知识来自互联网互联网的信息来自人类人类的知识并非全都明确。斯坦福大学2025年发表在《自然·机器智能》上的论文指出最新的大语言模型在验证事实性数据时的平均准确率最高只到91.5%而面对用户的错误信念时AI几乎无法可靠区分“他坚信的”和“事实”。AI搜索普及的原因真正有意思的问题不是“AI为什么犯错”而是“这么容易犯错为什么人们还在用”。人类并非没有选择拒绝AI搜索起码能用百度、Google等未掺和任何AI结果的传统搜索。然而每天被骂犯傻翻车的豆包月活3.45亿千问、文心、元宝、deepseek的用户规模也在高速增长AI搜索吞噬传统搜索的进程肉眼可见。传统搜索引擎只提供一长串网页链接完成相关性排序由用户自己分辨结果对错效率低下。AI搜索将用户获取信息的效率提高了几个数量级因为它只提供“唯一”答案但理论上这个结果必须100%准确。但“唯一答案”本就是低容错设计。如果用户将决策100%建立在可能错误的答案之上一旦出问题后果严重轻则上热搜闹笑话重则食用毒蘑菇去医院。这就像问路百度给地图让用户自己找走错了用户会感恩豆包告知方向走错了用户会痛骂。传统搜索追求“召回率”高而AI搜索追求“高效率”和“准确率”。既然AI搜索当前准确率才90%左右以谷歌Gemini为基准人们为何还是越来越爱用而不在传统搜索逗留呢这里抛出一个观点人类对信息精确度的需求实际上被高估了。在日常生活中99%的搜索场景并非用于做生死攸关的判断。查天气、做旅游攻略、研究护肤方法等场景信息稍有偏差不会造成严重后果。就如黎元洪这事对99%的使用场景而言只是茶余饭后的笑谈用户不会因此重新看待晚清史。但如果做学术研究、投资决策、医疗方案等使用AI搜索就不能怪AI犯傻因为这些场景下用户得到的信息必须100%准确AI搜索“答案仅供参考”。对于大多数搜索场景来说91%的准确率足够用了。而且在没有AI搜索的年代在小红书看减肥笔记、在搜索引擎搜“皮肤科好的医院”看到的信息也不一定是真的可能是广告。手机能不能放枕头下、大姨妈来了能不能喝冷水等问题本就没有标准答案AI不过是反映了人类的知识混乱。正是这种普遍存在的“91%准确率够用”的低风险需求让AI搜索日益普及。它的错误率虽高但只要错误不是彻底致命的人们总是更在意“效率”而不是“精确”。高后果场景下的AI使用当用AI搜索更复杂、更严肃、更“物理”的决策问题时这个逻辑就失效了。比如确认某种蘑菇能否食用涉及生命、健康、财产、风险和决策时91%的准确率可能会让人付出沉重代价。所以在医疗、法律、金融这种“高后果”场景领域出现了“专用AI”而非“通用AI”比如面向医疗健康场景的蚂蚁阿福但即便如此它们也无法保证100%不出错。人类使用AI需提升“信商”两千年前孟子说“尽信书不如无书”既然书籍上的知识都不一定正确我们又怎能100%绝对信任AI“尽信AI不如无AI”。有人开带辅助驾驶功能的电车高速上双手离开方向盘刷朋友圈出事后甩锅给车企但厂商把“驾驶员是操作车辆的第一责任人”写进了用户协议“小字没看到”也无法转移责任。在AI搜索获取信息方面情况是一样的。当人类越来越依赖AI时不仅要期待厂商训练AI更准确更要努力训练自己的判断能力。在智商、情商后AI时代人类的“信商”将越来越重要即真假信息甄别的能力素养。没有任何公司能提供100%准确的AI用户要把方向盘握在自己手里。任何系统都有bug任何AI吐出来的结果都可能是错的。记住这个常识是正确使用AI的第一步。AI收费与使用规范回到豆包身上黎元洪变范伟其实不影响“豆包该不该收费”的辩论关于“好的AI为什么一定要收费”已在另外一篇文章《付费版68元/月豆包也撑不住了》中讨论。澎湃新闻说在AI大规模收费之前或许应该“打扫干净屋子再请客”但AI的屋子永远扫不干净。ChatGPT收费版也不能确保100%准确因为没有AI能做到100%绝对准确。就算用于创作等生产力场景AI结果也不能、不应拿来就用。对结果的判断、审核、识别也就是“正确使用”是人在AI时代的核心价值。所以下次吃了毒蘑菇千万不要怪豆包。
返回列表