尧图网站设计 尧图网站设计YAOTU DESIGN
ARTICLE DETAIL

资讯详情

深耕网站设计与一线实操的经验洞察。

RAG 效果怎么评估

RAG 效果怎么评估 RAG 上线后最危险的状态不是“完全不能用”而是“看起来能聊、实际上经常答错却没人量化”。本文把评估拆成可执行的几层先评检索再评生成再看系统指标并给出一套最小评估集做法。RAG检索增强生成系列1/5RAG 检索增强生成从原理到 .NET 与 Python 实现2/5RAG 文档切分策略怎么选3/5RAG 中 Hybrid Search 与 Rerank 怎么配4/5用 FastAPI 与 ASP.NET 搭建 RAG 项目骨架一、为什么不能只靠“感觉还行”大模型回答流畅不代表 RAG 系统可靠。常见假象有答案读起来很像那么回事但关键事实错了检索其实没命中模型靠先验知识蒙对了换一批真实用户问题后命中率断崖下跌延迟和成本悄悄涨上去业务侧才发现扛不住所以评估的目标不是做一份漂亮报表而是回答四个问题找对了吗检索答对了吗生成正确性有没有瞎编忠实度 / 幻觉线上扛得住吗延迟、成本、稳定性二、先建立最小评估集没有评估集后面所有指标都悬空。先做小的不要一上来追求自动化大工程。1. 评估集长什么样每条样本至少包含建议规模起步30–50 条能指导迭代100–200 条上线门禁按业务模块持续补充而不是一次做完2. 问题从哪里来优先级从高到低真实用户问题 / 客服工单 / 搜索词业务方高频咨询文档目录反推出来的问题最后才是 LLM 批量生成的合成题合成题可以补覆盖但不要当唯一来源。它很容易和文档“长得太像”把系统估得偏乐观。3. 题型要分开看至少覆盖这几类三、第一层先评估检索生成再漂亮检索错了也是空中楼阁。检索指标应优先看。1. Hit RateK命中率最终送给模型的 Top-K 里是否包含至少一条标准相关文档 / 片段。HitK 命中样本数 / 总样本数这是最直观的“找没找到”。2. RecallK召回率如果一条问题对应多个必要证据看 Top-K 找回了多少。RecallK 找回的相关片段数 / 全部相关片段数适合多跳、多条款问题。3. MRRMean Reciprocal Rank看第一条正确结果排得有多靠前。单题得分 1 / 首个正确结果的排名 MRR 所有题目得分的平均如果相关内容总在第 8 名而你只取 Top-4命中率仍会差。4. nDCGK既看有没有也看排序质量。有标注分级相关性时更有用刚起步可以先不做。实务建议对大多数业务 RAG先盯这两个Hit5检索有没有把正确答案捞进候选Hit最终上下文K如 Hit4真正喂给模型的那几段有没有金标如果 Hit20 高、Hit4 低说明召回还行、精排不够优先加 Rerank。如果 Hit20 就低先查切分、Embedding、解析而不是先换更大的生成模型。四、第二层再评估生成检索过关后才轮到看答案。1. 正确性Correctness答案是否与golden_answer/ 业务事实一致。可用人工打分正确 / 部分正确 / 错误关键点核对must_include是否都覆盖LLM-as-Judge让强模型对照参考答案打分要抽检不能全信2. 忠实度Faithfulness答案是否能被检索到的上下文支持而不是模型靠自己知识补出来。这是 RAG 最关键的指标之一。典型反例上下文只写“可请假”模型却补充“最长不超过 3 天”后半句如果原文没有就是不忠实3. 拒答率 / 拒答准确率当should_abstain true时系统是否明确说“根据现有资料无法确认”。这里要看两个方向一个健康的系统不是拒答越多越好而是该拒就拒、该答就答。4. 引用质量如果返回 citations额外看引用是否真被答案用到引用是否指向正确片段有没有“答案一套、引用另一套”没有可靠引用时排障会非常痛苦。五、一套好用的人工评分表自动化还没建起来时先用 0–2 分量表也能迭代每条样本总分不必过度精细。先保证每周能复评一轮比指标体系完美更重要。六、第三层系统与工程指标效果指标过关还要看能不能上线。一个常见现象加上 Rerank 后 Hit4 提升明显但 P95 延迟多了 300ms。这时要用业务场景决定客服坐席助手也许能接受手机端即时问答未必。七、怎么做回归而不是一次性测评把评估嵌进迭代而不是上线前拍脑袋看两眼。推荐节奏改切分 / 换 Embedding / 加 Hybrid / 加 Rerank ↓ 跑同一份评估集 ↓ 对比 HitK、正确性、忠实度、拒答、延迟 ↓ 只有关键指标不回退才合并变更建议固定对比的基线每次至少对比当前线上版仅改检索的新版仅改 prompt 的新版一次改太多最后不知道是谁带来的收益或回退。坏案例本比平均分更值钱每次评完把失败题沉淀成badcases.md问题期望命中实际命中模型回答失败类型切分 / 召回 / 精排 / 幻觉 / 拒答下一轮优化优先打这些洞比盲目调参有效得多。八、自动化评估怎么起步人工评 50 条可以起步到 100 条以上建议加半自动。1. 检索自动化优先做检索有金标 ID最好自动化def hit_at_k(retrieved_ids: list[str], golden_ids: set[str], k: int) - float: return 1.0 if any(i in golden_ids for i in retrieved_ids[:k]) else 0.0对整个评估集求平均就能得到 HitK。2. 关键点核对def covers_must_include(answer: str, keywords: list[str]) - bool: return all(k in answer for k in keywords)适合制度、套餐、时效这类“必须提到关键约束”的题。3. LLM-as-Judge慎用但有用让评判模型输出结构化结果例如请根据【参考答案】和【检索上下文】评估【候选答案】 1) correctness: 0/1/2 2) faithfulness: 0/1/2 3) abstain_ok: true/false 并给出简短理由注意评判模型要尽量强且稳定temperature 调低定期抽 10%–20% 做人审校准不要把 LLM 分数当成唯一上线门禁4. 现成框架可以借鉴但别被绑死如 Ragas 等工具能提供 Faithfulness、Answer Relevancy 等指标。可以借用思路但业务上仍建议保留自己的金标命中自己的拒答集自己的坏案例库通用分数解释不了你的业务对错。九、Python / .NET 里怎么挂评估不一定要单独做成大平台先从“可重复脚本”开始。Python 最小思路eval/ dataset.jsonl run_eval.py reports/ 2026-07-09.jsonrun_eval.py做的事读评估集调/ask或直接调本地rag.ask()同时记录 retrieved ids 与最终答案算 HitK、关键点覆盖、拒答是否正确输出汇总与坏案例列表.NET 最小思路同样可以做一个控制台项目RagEval读dataset.json调RagService输出 Markdown / JSON 报告关键是评估代码与业务代码解耦但共享同一套检索生成实现避免“评的是 A上线的是 B”。十、不同阶段看重不同指标一个简单门禁示例可按业务改Hit4 0.85 人工抽检正确率 0.90 应拒答题目的拒答准确率 0.90 P95 延迟 业务上限 单次成本 预算上限不达标就别靠“再换个更强聊天模型”硬上。十一、常见误区只评最终答案不评检索会把“蒙对”当成系统能力。只用 LLM 生成的合成题容易高估尤其是问法和原文过于接近时。追求复杂指标却没有每周复跑评估贵在持续不在一次做全。把流畅度当正确性文笔好不等于事实对。忽视拒答集不能答的时候乱答往往比答得略保守更伤信任。上线后不再回流坏案例离线集会过时真实问题分布会漂。十二、收束RAG 评估可以很复杂但起步不必复杂。按这个顺序就很稳先建 30–50 条真实问题评估集先把 HitK 做起来确认找得到再看正确性、忠实度、拒答最后卡延迟和成本每次改动都回归并把坏案例沉淀下来记住一句很实用的话检索指标告诉你系统有没有机会答对生成指标告诉你系统有没有把机会用对工程指标告诉你这套东西能不能天天跑。评估不是文章的收尾动作而是后续所有优化的方向盘。没有它切分、Hybrid、Rerank、换模型都只是在黑暗里调参。学AI大模型的正确顺序千万不要搞错了2026年AI风口已来各行各业的AI渗透肉眼可见超多公司要么转型做AI相关产品要么高薪挖AI技术人才机遇直接摆在眼前有往AI方向发展或者本身有后端编程基础的朋友直接冲AI大模型应用开发转岗超合适就算暂时不打算转岗了解大模型、RAG、Prompt、Agent这些热门概念能上手做简单项目也绝对是求职加分王给大家整理了超全最新的AI大模型应用开发学习清单和资料手把手帮你快速入门学习路线:✅大模型基础认知—大模型核心原理、发展历程、主流模型GPT、文心一言等特点解析✅核心技术模块—RAG检索增强生成、Prompt工程实战、Agent智能体开发逻辑✅开发基础能力—Python进阶、API接口调用、大模型开发框架LangChain等实操✅应用场景开发—智能问答系统、企业知识库、AIGC内容生成工具、行业定制化大模型应用✅项目落地流程—需求拆解、技术选型、模型调优、测试上线、运维迭代✅面试求职冲刺—岗位JD解析、简历AI项目包装、高频面试题汇总、模拟面经以上6大模块看似清晰好上手实则每个部分都有扎实的核心内容需要吃透我把大模型的学习全流程已经整理好了抓住AI时代风口轻松解锁职业新可能希望大家都能把握机遇实现薪资/职业跃迁这份完整版的大模型 AI 学习资料已经上传CSDN朋友们如果需要可以微信扫描下方CSDN官方认证二维码免费领取【保证100%免费】
返回列表