尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

当CLIP认错人的时候,你的AI助手在瞎猜答案

当CLIP认错人的时候,你的AI助手在瞎猜答案 你有没有遇到过这种情况把一张老照片给人看对方一脸茫然地说这是谁啊而你明明记得这个人的样子只是照片拍得年代久远、角度奇怪、光线也不对。人脑很擅长处理这种情况透过表面的视觉差异,认出同一个人或者同一个东西。但一个专门做图文检索的AI系统可能就没那么聪明了。这就是这篇论文要讲的故事。故事的主角是一类叫做知识型视觉问答的任务主角遇到的麻烦,恰恰就是认人这件事。先说说这个任务到底是什么。假设你拍了一张照片,问AI这栋建筑现在归谁所有,AI光看图片是答不出来的,因为这需要额外的百科知识。这时候系统会去一个庞大的知识库里比如维基百科找一张长得像的图片把对应的文字资料抓出来再让AI读资料后回答问题。这个找长得像的图片的步骤就是整个流程里最脆弱的环节。问题出在哪里几乎所有做这件事的系统用的都是一种叫CLIP的技术。CLIP*一种能把图片和文字都映射到同一个数学空间里的模型通过比较图片和图片、或图片和文字在这个空间里的距离判断它们是不是描述同一个东西。CLIP的强项是分辨这张图里有没有一只猫这是不是一片森林这类视觉层面的相似性。但知识型问答要解决的问题完全不是这个层次。论文举了个特别直观的例子一张酒店的照片CLIP在维基百科图库里找相似图片时排在前面的结果全是看起来像这家酒店的建筑,包括某个博物馆、某个别的度假村,真正对的那家酒店反而排到后面去了因为不同年代拍的照片风格差异太大。系统最后从错误资料里读到了错误的酒店所有者信息答案自然就错了。这揪出了一个很本质的矛盾视觉上看起来像不代表它们说的是同一件事。反过来也一样同一栋建筑十年前和现在拍的照片视觉上可能天差地别但它们指向的是同一个知识实体。打个比方这就像你去菜市场找那种圆圆的绿色蔬菜如果只按照外形去找你可能会把苦瓜和黄瓜搞混因为它们从远处看确实有点像。但如果你问的是哪种蔬菜叫苦瓜答案是唯一确定的跟它长得像不像别的东西没关系。CLIP干的事情更接近前者按外形归类而知识型问答真正需要的是后者认准这个具体的实体身份。如果继续用CLIP去做这件事检索环节永远会有一批看着像但其实答非所问的候选资料混进来后面无论多强的语言模型来读资料都是在错误的地基上盖楼。在这篇论文之前学界的应对办法基本是在CLIP外面打补丁比如做多阶段检索、让另一个模型去重新排序候选结果、或者对问题做各种改写增强。这些办法确实能带来提升但检索这一步产出的候选池本质上还是CLIP给的天花板没有被打破。这篇论文选择了一条不一样的路既然CLIP的表示方式先天就不适合这个任务那就换一种模型来做检索。用大模型直接当检索器论文提出的方法叫KBMR它做的第一件事是不再用CLIP那种图片塔加文字塔各自独立编码再对比的双塔结构而是直接找一个多模态大语言模型来干检索的活。MLLM*多模态大语言模型能同时理解图片和文字通常由一个视觉编码器、一个连接层和一个语言模型主体组成具备类似ChatGPT那样的连续推理和生成能力。为什么大模型更适合干这件事因为CLIP在训练时的目标本质上是学会这段文字描述的是不是这张图它学到的更多是场景、物体类别这类比较粗的语义。而大模型经过大量指令数据训练之后具备一种更细腻的理解能力它不仅知道这是一只鸟还能顺着上下文琢磨这只鸟具体是哪个物种跟另一张照片里的鸟是不是同一种。具体的做法其实挺巧妙。研究者给大模型一句提示语类似用一个词总结上面这张图片然后不去看大模型真正说出来的那个词而是截取它在生成这个词之前内部产生的最后一个隐藏状态把这个隐藏状态直接当成这张图片的数字指纹拿去做相似度比较。这一步的设计思路值得琢磨。大模型的强项在于它处理信息时是层层递进、带着上下文推理的如果只看它最终吐出来的文字反而丢掉了这个推理过程里积累的丰富信息。而抓取生成前一刻的隐藏状态相当于把大模型脑子里正在想的东西直接拿出来用比等它把话说完再去分析文字本身信息量要大得多。这跟你让一个专家口头总结一件复杂的事,总结出来的三五个字肯定比他脑子里真实掌握的内容要少得多。如果只依赖那三五个字去做后续判断会漏掉大量细节而直接看专家脑子里此刻活跃的那些神经信号,虽然听起来有点科幻,但确实保留了更完整的判断依据。不过光是换个模型来编码图片还不足以让检索变准。真正的难点在训练数据上。训练数据的噪音困境维基百科规模的知识库里正样本也就是这确实是同一个实体的图文配对相对好找但要训练出一个能分辨细微差异的检索器还需要大量高质量的负样本也就是那些看起来像但其实不是的干扰项。这里就出现了一个新麻烦怎么判断一个候选样本到底是不是看起来像但其实不是靠人工标注维基百科规模的数据量根本标不完靠简单规则又抓不住那种视觉相似度极高、但实体身份完全不同的边界案例。论文给出的解法是再请一个大模型来当裁判论文管它叫语义判别器。语义判别器*一个专门用来判断查询图片和候选图片是否指向同一个实体的辅助大模型它不直接输出检索结果而是给每一对图片打一个连续的置信度分数。这个判别器的工作方式很直接给它一段提示问这两张图说的是同一个实体吗回答是或否然后不看它最终回答的文字而是看它在说是和说否这两个词时模型内部计算出的原始概率倾向哪个更强。这两个倾向经过一个数学变换后会变成一个0到1之间的分数分数越接近1说明这两张图越可能是同一个实体越接近0说明越不像。这里有个细节特别关键判别器给出的不是简单的是/否二元判断而是一个连续的分数。这个设计背后的用意是承认现实世界的相似程度本来就是一个渐变的谱系不是非黑即白。有的候选样本跟目标实体的关系是完全不相关有的是视觉上极其相似但确实是另一个东西还有的是部分特征相关但主体不同。如果强行把这些情况都压缩成0和1两个标签训练信号里损失的信息就太多了。论文用一组数据验证了这个判别器确实靠谱他们专门做了一个测试拿一万对确实是同一实体的图片和一万对确实不是同一实体的图片分别用CLIP的相似度分数和判别器的置信度分数去区分这两类结果判别器的区分能力用AUC衡量,数值越接近1说明区分能力越强达到0.91而CLIP只有0.79。这个差距不小说明CLIP的相似度分数里混杂了大量长得像但不是一回事的噪音而判别器确实抓住了更接近实体真实身份的信号。有了这个判别器接下来要解决的是怎么挑出真正有训练价值的负样本。挑负样本也要讲究方法如果负样本选得太随便比如随手从知识库里抓一批完全不相关的图片模型很快就能学会分辨它们但这种容易的负样本训练不出真正的辨别力因为现实中检索器真正会犯错的地方恰恰是那些容易混淆的边界情况。论文的做法分了三步。第一步先用普通的CLIP做一轮粗筛把跟查询图片视觉上最相似的前50张候选图挑出来形成一个潜在负样本池这一步的意图很朴素:既然CLIP的弱点就是容易把视觉相似但实体不同的东西搞混那正好可以拿这个弱点来批量制造高质量的干扰项。第二步用前面说的判别器给这个池子里的每一张候选图都打分,判断它跟查询图片是不是同一实体。如果分数太高接近于查询图片和它真正的正样本之间的分数那说明这个候选图其实语义上也非常相关硬把它当负样本训练反而会误导模型这类样本会被过滤掉。第三步为了保证保留下来的负样本难度分布均匀研究者按判别器给出的分数把候选样本分成四个难度档次每个档次随机抽两个凑成一个固定数量的负样本集合。这个分层抽样的设计其实是在防止一种偷懒的倾向如果只挑分数最高的那几个负样本训练会变得极度不稳定模型很容易在这些极端案例上过拟合但如果负样本难度参差不齐、覆盖各个梯度模型能学到的是一种更连续、更细腻的判断能力就像练习乒乓球发球如果教练每次都发最难接的球学员练不出基本功还容易受挫放弃但如果球路难度从易到难都覆盖到学员反而能建立起完整的应对体系。这就是为什么论文特意设计了分层采样而不是简单粗暴地只挑最像的那几个候选。数据构建好了接下来就是怎么用这批数据去训练检索器本身。用软监督替代硬标签传统的对比学习训练方式很直接一个正样本剩下所有候选全当负样本一视同仁地推远。对比学习*一种常见的模型训练思路让模型学会把相关的样本在表示空间里拉近把不相关的样本推远。论文认为这套思路在知识型检索里是有缺陷的。原因还是回到前面说的那个核心矛盾负样本之间的错误程度其实是不一样的有的负样本几乎完全不相关有的负样本却带着相当高的语义关联度如果统一按完全错误处理模型学到的区分度会显得很粗糙。于是论文把训练问题重新表述成一个分布对齐问题。检索器自己会根据当前学到的相似度给候选集合里每个样本算出一个概率分布这个分布代表检索器当下的判断。同时判别器给出的那些连续置信度分数也可以经过归一化变成另一个概率分布代表一个更接近真实语义关系的标准答案分布。训练的目标就是让检索器自己的判断分布逐渐向判别器给出的标准答案分布靠近具体用的是一种叫KL散度的数学工具来衡量两个分布之间的差异并且是双向计算既让检索器往判别器那边靠也防止检索器学得过于极端死板。KL散度*一种衡量两个概率分布之间差异程度的数学指标数值越小说明两个分布越接近。这个设计换个角度想其实很像老师批改一份主观题不是简单打对错而是给出一个这道题答对了百分之几的评分学生如果照着这个细致的评分去调整答案学到的东西会比单纯知道对或错丰富得多。如果只告诉学生对错学生下次遇到类似但不完全相同的题目很可能还是没有判断力因为他没学到为什么对错在哪个程度这层信息。这正是论文选择用连续分布蒸馏而不是传统二元标签硬训练的根本原因。方法讲完了接下来看看这套流程实际跑起来效果怎么样。数据说话论文在三个知名的知识型问答测试集上做了检验分别是E-VQA、InfoSeek和OK-VQA。先看检索本身的表现也就是系统能不能在候选池里把正确资料排到前面这个能力用的指标叫Recall1指第一个检索结果就命中正确答案的比例。在E-VQA这个数据集上表现最强的CLIP系模型EVA-CLIP-8BRecall1是13.3%而论文提出的KBMR用LLaVA-OneVision这个大模型做底座达到了24.7%差距超过11个百分点。在InfoSeek数据集上最强CLIP模型是45.6%KBMR做到了60.3%差距接近15个百分点。这里有个特别值得说的现象论文也尝试直接拿现成的大模型没有经过论文提出的训练方法去做检索结果发现这些裸大模型的检索效果反而普遍不如CLIP。这说明光换个模型架构是不够的真正起作用的是那套用判别器生成软监督、再做分布蒸馏训练的完整流程。这也印证了前面那个判断大模型确实有更强的语义理解潜力但这个潜力需要经过针对性的训练才能真正释放到检索任务上。再看下游任务的效果。检索准不准最终要看它有没有真正帮到问答系统给出正确答案。论文把KBMR接入了好几套现有的知识型问答系统包括EchoSight、ReflectiVA、MMKB-RAG和OMGM只替换掉这些系统原本的检索环节其他部分保持不动。结果显示几乎所有系统接入KBMR之后都有明显提升。以EchoSight带重排序的版本为例在E-VQA上的准确率从41.8%提升到51.0%提升了9.2个百分点在InfoSeek上从31.3%提升到39.2%提升7.9个百分点。OMGM系统在E-VQA上从50.2%提升到54.7%最终跑出了当时最好的成绩。在OK-VQA数据集上KBMR配合LLaVA-OneVision把最终问答分数拉到79.3分比原来的OMGM系统高出12.7分。这组数字背后的意义值得多说一句一个只改进了检索环节的模块居然能给多个不同架构、不同设计思路的下游系统都带来实打实的提升说明检索确实是整条流程里被低估的瓶颈。之前学界把大量精力花在后面的重排序、过滤、推理这些环节上某种程度上是在给一个地基不稳的房子加固上层结构。论文还专门做了一系列细节实验来验证每个设计决策是不是真的有必要。比如他们对比了不同的负样本挑选方式完全随机挑选、用CLIP相似度挑选、用判别器挑选配合硬标签或者软标签训练一共测了六种组合。结果显示只有同时用判别器挑负样本、又用判别器给出的连续分数做训练目标的那个组合效果才是最好的,单独换负样本挑选方式或者单独换标签形式提升都有限。这说明这套方法真正的价值在于挑对负样本和给出细腻监督信号两件事要配合着做缺一不可。论文也测了如果故意把判别器给出的分数搞乱比如把30%的样本分数人为颠倒效果会怎样,结果是明显变差甚至比全用硬标签还差。这从反面证明了判别器给出的软标签信号本身是真实有效的不是随便加个噪音就能凑效果。另外几个小实验也挺有意思负样本数量从4个增加到8个效果持续提升但从8个加到10个就基本没变化了说明8个左右是一个性价比比较高的选择控制标签平滑程度的一个参数论文里叫语义锐度系数调到1.1时效果最好调得太小标签会变得跟硬标签差不多失去软监督的意义调得太大又会让不同候选之间的区分度被抹平。最后论文还放了一个具体的检索案例一张犀鸟属鸟类的照片CLIP检索出来的前五个结果里混进了好几种视觉上相似但完全不同的鸟类真正对的那个物种排到了第五位而KBMR直接把正确的物种排在第一位后面几个候选结果也都是分类学上相近的鸟类检索出来的整体候选池语义上更加连贯。这个例子直观地体现了整篇论文想解决的核心问题视觉相似度和真实的语义身份本来就不是一回事而这套方法确实缩小了两者之间的鸿沟。写在后面读这篇论文的过程中一个念头一直在脑子里转检索这个环节在过去很长一段时间里好像被当成了一个配角来对待。大家更愿意在生成答案的那个大模型身上下功夫觉得只要生成端够聪明就能弥补前面检索不准的问题。这篇论文其实在提醒一件事如果地基本身就搭错了方向后面盖多高的楼都会歪。还有一个细节我觉得挺值得单独说说判别器的AUC是0.91,CLIP是0.79,这个差距看起来不算特别夸张但放到实际检索场景里它意味着在那些看起来最像但其实不是的高难度候选样本堆里判别器能多识别出接近两成的真正错误配对。而这恰恰是整条检索流程最容易翻车的地方,越相似的候选越容易被误判为正确答案一旦误判后面的整个问答链条就建立在错误的知识资料上。这个环节的可靠性提升杠杆效应比想象中要大。论文里也留了一个没完全说透的问题这套判别器本身依赖另一个大模型的理解能力如果换一个理解能力更弱的模型来当裁判整条训练流程的质量会打几折论文确实做了对比换成参数量更小的InternVL3-8B效果会下降换成更大的InternVL3-14B又能补回来一些但没有再往更极端的方向去探索这个边界在哪里。裁判的水平决定了整个训练数据的质量上限这件事本身或许值得单独拿出来做一篇论文。QAQ1KBMR是什么AKBMR是一种专门为知识型视觉问答任务设计的检索方法它用多模态大语言模型代替传统CLIP做图片检索能更好地识别同一实体在不同视觉表现下的语义一致性从而找到真正相关的知识资料。Q2为什么CLIP在知识型问答检索里表现不好A因为CLIP主要学习的是视觉层面的相似性而知识型问答需要的是识别同一实体的能力。同一个实体在不同年代、角度拍摄下视觉差异可能很大而不同实体也可能长得很像这种情况下CLIP容易检索出看起来像但语义不对的资料。Q3KBMR相比传统方法能带来多大的提升A在检索准确率上KBMR在InfoSeek数据集上比最强CLIP模型提升了近15个百分点的Recall1接入多个现有问答系统后最终问答准确率普遍提升了7到9个百分点在OK-VQA上甚至提升了12.7分。
返回列表