
本文深入探讨了在AI面试中如何评估RAG系统的embedding效果。作者强调不应仅依赖MTEB榜单而应使用50个真实用户问题及对应的“标准答案资料”来评估系统的hit10、recall10和MRR等指标。文章指出评估的关键在于使用真实业务问题关注系统是否找得到正确资料以及如何处理内部缩写、代码、订单号等复杂问题。作者建议先通过公开榜单进行粗筛再使用业务测试集进行最终评估并提供了一套详细的评估checklist以供参考。AI 落地面试深水区 · 第 02 课 · RAG 深挖篇 2/14RAG 高频判断题Embedding 怎么评估光看 MTEB 榜单行不行别被榜单骗了50 个真实问题往往比一个公开排名更能说明企业 RAG 到底靠不靠谱。先把术语翻成人话RAG先找资料再回答embedding文字变数字看像不像query用户真实问题gold doc标准答案资料hit10/recall10找没找到MRR排第几一、面试现场面试官提问“你们 RAG 用的什么 embedding怎么评估它好不好”阿里巴巴 AI 平台一面。简历上写了基于内部知识库做了一套问答 Copilot面试官没绕弯子直接抛过来。这一题表面问的是模型选型实际考的是你能不能把把问题和文档变成向量这一步放回真实业务里判断。**直接回答先拿 50 个真实用户问题再为每个问题标出标准应该找到哪份资料。然后看系统前 10 个候选里有没有这份资料以及它排在第几位。**专业一点说这就是用业务 query gold doc 跑hitk/recallk和MRR。我的判断是没有自家测试集的 embedding 选型本质上只是换模型抽盲盒。二、大多数人怎么答的典型翻车回答“看 MTEB 榜单选 top-3再换个更大的模型检索效果就上去了。”这个回答有一点对MTEB能做第一轮粗筛把候选模型从几十个砍到 3-5 个。但榜单测的是通用考试题你的系统面对的是公司自己的题内部工单、合同、代码库、客服记录。我见过公开榜单靠前的模型换到法务 PDF 上前 10 个候选里的命中率反而低 12 个点。换更大的模型也一样。截至 2026-05-02OpenAI text-embedding-3-large、Voyage-4-large、BAAI/bge-m3在不同领域上的胜负关系是交叉的。把大 准当标准等于跳过了最关键的一步它在你的资料库里到底找不找得到正确资料。三、深度解析把这题翻成人话用户用自己的话提问时系统能不能把正确资料找出来****我认为真正的分水岭不是你报出哪个模型名而是你能不能拿出一张哪些问题找得到、哪些问题找不到的失败样例表。我会先看找不找得到再看排得靠不靠前最后看失败集中在哪类问题上。判断一用真实问题不用考试题MTEB/C-MTEB是公开考试题你的业务问题更像报销限额是多少标准答案在《差旅报销管理办法》第三条。关键在于评估对象必须是真实用户问题 你库里的正确资料这对数据。50 条高频问题加专家标注就够起步不要一上来追求 5000 条。判断二先看找不找得到再看排第几单个标准答案的场景先看hitk前 k 个候选里有没有命中那条正确资料多个标准答案的场景再看recallk正确资料被找回了多少比例。我认为先用hit10/recall10判断找不找得到再用MRR判断排得靠不靠前。不要只看 cosine 均值它更像平均相似度不能直接说明用户能不能拿到正确资料。判断三要覆盖真实麻烦问题企业 RAG 最容易翻车的不是标准问法而是五类麻烦问题同一句话的不同说法、公司内部缩写、中英混着问、订单号/错误码这类精确字符、以及很长很口语的问题。这些东西在公开榜单里不一定多但在你的知识库里可能天天出现。判断四失败样例的 trace 比平均分更重要平均分会把问题盖住。工程动作给每条问题打一个类型标签跑完后按标签分组看recall10再把失败问题单独拿出来看是资料切得不对、模型不认识内部词还是标准答案本身标错了。这套数据沉淀下来就是回归集每次换模型、换切分策略都重跑。四、面试官追问链追问 1“如果 recall10 高但答案仍然差是 embedding 的问题吗”大概率不是。前 10 个候选里已有正确资料说明找资料不算坏问题多半在后面重排没把它推到前 3提示词没要求优先看高排名片段或引用被裁断。处理顺序是先看重排再调提示词最后才动 embedding。追问 2“怎么用 50 条 query 做一个最小 embedding eval”五步就够抽 50 条真实问题标出每题应该找到的 1-3 篇资料跑两个候选模型看前 5 / 前 10 是否命中、排第几再按问题类型分组。50 条不是上限是起跑线跑通后再扩到 200。追问 3“为什么领域术语多的系统可能需要 hybrid search 而不是只换 embedding”因为内部缩写、产品型号、订单号不像自然语言更像精确字符。比如SKU-X1932、ORD20260418关键词检索反而更可靠。更值得做的是语义搜索找一批关键词搜索找一批合并后再重排。五、最小 eval 长什么样把方法落到表上就是每个问题都有问题类型和标准资料前者用于分组诊断后者用于判断系统到底找没找到。业务 query类型gold doc差旅报销限额是多少同义EXP-03SKU-X1932 下架了吗术语TKT-1102LOGISTICS_TIMEOUT 怎么处理代码LOG-07上周工单怎么还没回长问法FAQ-11跑完后不要只看平均分按类型聚合弱在哪一眼就能看出来Query 类型RecallMRR诊断同义改写0.920.71先不动缩写术语0.340.18加BM25跨语言0.610.42看样例数字代码0.280.14关键词兜底长 query0.780.55加 rerank这张表读完结论不是换更大的 embedding而是缩写与数字代码加关键词兜底长问题加重排同义改写先不动。↳ 复盘数字匿名项目复盘仅换 embedding整体recall10从0.74 → 0.78加关键词兜底 重排后整体0.74 → 0.91缩写类0.34 → 0.82。这不是公开基准只说明诊断方向。我的判断关键在于先把评估闭环跑通——同一份 200 条样本上跑过 3 个 embedding比只看 MTEB 排行榜有用得多。我的优先顺序是公开榜单粗筛业务测试集定最终选择。结语抓住大模型时代的职业机遇AI大模型的发展不是“替代人类”而是“重塑职业价值”——它淘汰的是重复性、低附加值的工作却催生了更多需要“技术业务”交叉能力的高端岗位。对于求职者而言想要在这波浪潮中立足不仅需要掌握Python、TensorFlow/PyTorch等技术工具更要深入理解目标行业的业务逻辑如金融的风险控制、医疗的临床需求成为“懂技术、懂业务”的复合型人才。无论是技术研发岗如算法工程师、研究员还是业务落地岗如产品经理、应用工程师大模型都为不同背景的职场人提供了广阔的发展空间。只要保持学习热情紧跟技术趋势就能在AI大模型时代找到属于自己的职业新蓝海。最近两年大模型发展很迅速在理论研究方面得到很大的拓展基础模型的能力也取得重大突破大模型现在正在积极探索落地的方向如果与各行各业结合起来是未来落地的一个重大研究方向大模型应用工程师年包50w属于中等水平如果想要入门大模型那现在正是最佳时机2025年Agent的元年2026年将会百花齐放相应的应用将覆盖文本视频语音图像等全模态如果你对AI大模型入门感兴趣那么你需要的话可以点击这里大模型重磅福利入门进阶全套104G学习资源包免费分享扫描下方csdn官方合作二维码获取哦给大家推荐一个大模型应用学习路线这个学习路线的具体内容如下第一节提示词工程提示词是用于与AI模型沟通交流的这一部分主要介绍基本概念和相应的实践高级的提示词工程来实现模型最佳效果以现实案例为基础进行案例讲解在企业中除了微调之外最喜欢的就是用提示词工程技术来实现模型性能的提升第二节检索增强生成RAG可能大家经常会看见RAG这个名词这个就是将向量数据库与大模型结合的技术通过外部知识来增强改进提升大模型的回答结果这一部分主要介绍RAG架构与组件从零开始搭建RAG系统生成部署RAG性能优化等第三节微调预训练之后的模型想要在具体任务上进行适配那就需要通过微调来提升模型的性能能满足定制化的需求这一部分主要介绍微调的基础模型适配技术最佳实践的案例以及资源优化等内容第四节模型部署想要把预训练或者微调之后的模型应用于生产实践那就需要部署模型部署分为云端部署和本地部署部署的过程中需要考虑硬件支持服务器性能以及对性能进行优化使用过程中的监控维护等第五节人工智能系统和项目这一部分主要介绍自主人工智能系统包括代理框架决策框架多智能体系统以及实际应用然后通过实践项目应用前面学习到的知识包括端到端的实现行业相关情景等学完上面的大模型应用技术就可以去做一些开源的项目大模型领域现在非常注重项目的落地后续可以学习一些Agent框架等内容上面的资料做了一些整理有需要的同学可以下方添加二维码获取仅供学习使用