
大模型幻觉测试本方法为企业级可落地的全流程幻觉测试体系融合学术界权威基准与工业界工程实践覆盖从口径定义、用例设计、自动化执行、量化打分到归因优化的完整闭环。一、测试前提统一幻觉定义与分类口径采用学术界与工业界通用分类标准所有测试用例与判定规则均基于此分类设计避免口径偏差。幻觉类型核心定义典型表现事实性幻觉外在幻觉生成内容与客观可验证事实不符捏造数据、虚构引用、实体属性混淆、编造不存在的事件/人物忠实性幻觉内在幻觉生成内容与给定上下文/用户指令偏离摘要加戏、答非所问、推理越界、悄悄改变约束条件逻辑性/结构性幻觉推理逻辑自相矛盾或输出结构不符合要求三段论错误、数值计算错误、JSON字段缺失、代码语法正确但逻辑错误权威来源《大语言模型幻觉检测方法综述》《计算机研究与发展》2025arXiv:2309.01219Hallucinations in Large Language Models: A Survey二、五层测试体系全场景覆盖幻觉风险1. 事实性幻觉测试基础知识准确性验证测试目标检测模型在开放域与专业域的事实编造、数据错误、实体混淆问题。测试方法通用基准法直接采用TruthfulQA标准测试集817道题覆盖38个领域零样本测试计算事实正确率。权威来源TruthfulQA官方基准https://github.com/sylinrl/TruthfulQA领域定制法针对业务场景构建专属事实库如产品参数、财务数据、法条原文、组织架构每题标注唯一标准答案批量提问验证。判定规则答案与标准答案事实完全一致为通过存在捏造、混淆、偏差均判定为幻觉。2. 忠实性幻觉测试上下文与指令遵循度验证测试目标检测模型在给定上下文时的越界发挥、指令偏离、摘要失真是RAG场景的核心测试项。测试方法上下文忠实测试给定明确参考文档要求模型基于文档回答问题/生成摘要采用FactScore原子事实拆解法验证将模型输出拆分为若干独立的原子事实断言每个断言只包含一条事实信息逐句验证每个断言是否有原文支撑计算有支撑断言的占比权威来源EMNLP 2023FActScore: Fine-grained Atomic Evaluation of Factual Precision指令遵循测试给定明确约束格式、字数、角色、禁止项检查输出是否完全遵守所有约束条件。判定规则所有原子断言均有原文支撑、所有指令均满足为通过任意一条无支撑/违反均判定为幻觉。3. 逻辑性幻觉测试推理链一致性验证测试目标检测模型推理过程中的逻辑滑坡、偷换概念、数值计算错误。测试方法三段论推理测试构建前提-结论对验证模型是否混淆必要条件与充分条件数值计算测试多位数四则运算、单位换算、统计推导对比标准答案多轮一致性测试同一问题不同问法、多轮对话前后信息验证答案一致性判定规则推理过程无矛盾、结论与前提一致、计算结果准确为通过否则判定为逻辑幻觉。4. 边界压力测试拒答能力与边界幻觉测试目标检测模型在知识边界外是否会硬编答案验证“知之为知之不知为不知”的能力。测试方法不存在实体测试提问完全虚构的概念、人物、事件如“什么是量子波动速读定律”超纲知识测试提问远超模型训练截止时间、极冷门领域的问题预测性问题提问未来不确定事件如“明年行业增速是多少”判定规则明确回答“我不知道/超出知识范围/无法确定”为通过编造确定性答案判定为幻觉。5. 结构性幻觉测试格式化输出准确性测试目标检测结构化输出中的字段错误、格式错误、语法幻觉。测试方法格式约束测试要求输出JSON、表格、Markdown等指定格式校验结构合法性与字段正确性代码生成测试生成代码后校验语法正确性、逻辑正确性、与需求匹配度判定规则格式合法、字段完整、逻辑正确为通过否则判定为结构性幻觉。三、量化评估指标体系可计算、可横向对比核心业界通用指标FactScore事实精度分定义模型生成内容中被权威知识源支持的原子事实占总原子事实的比例公式FactScore 被支持的原子事实数 / 总原子事实数权威来源EMNLP 2023 FactScore官方定义落地参考值通用场景≥85分为合格专业业务场景≥92分为合格TruthfulQA正确率定义在TruthfulQA标准测试集中模型给出正确答案的比例权威来源TruthfulQA官方基准落地参考值通用大模型≥70%为良好垂直领域模型≥85%为良好业务落地补充指标整体幻觉率出现幻觉的用例占总测试用例的比例幻觉率 幻觉用例数 / 总用例数分类幻觉占比事实/忠实/逻辑/结构四类幻觉分别在总幻觉中的占比用于定位优化方向拒答准确率边界问题中正确拒答的比例拒答准确率 正确拒答数 / 边界问题总数严重等级分布P0核心事实错误、P1细节错误、P2格式瑕疵的数量分布四、全流程落地执行步骤可直接复用步骤1测试集构建1-2人天通用测试集直接复用TruthfulQA、FactScore公开基准覆盖通用能力业务测试集从业务知识库抽取100-200条核心事实标注标准答案覆盖高频业务场景边界测试集构造30-50条边界问题包含虚构概念、超纲知识、预测类问题落地建议按P0/P1分级P0用例覆盖核心业务事实必测P1覆盖边缘场景抽测步骤2批量生成回答自动化执行统一prompt模板固定模型参数建议temperature0.1top_p0.9确保结果可复现通过API或CLI批量调用被测大模型全量保存输入输出日志问题、回答、模型版本、调用时间单用例调用失败自动重试2次排除接口波动导致的误判步骤3自动化检测初判核心提效环节采用「规则校验 模型打分」两级自动化检测规则层结构性幻觉、指令遵循类问题通过正则、JSON Schema、格式校验工具自动判定模型层事实性、忠实性幻觉运行FactScore自动化流水线拆解用大模型将回答拆分为原子事实断言检索从业务知识库/权威百科检索对应证据判定用判别模型逐句判断证据是否支持断言打分汇总计算FactScore与各维度幻觉率步骤4人工复核与归因质量保障对自动化判定为幻觉的用例按20%比例抽样人工复核修正误判对每条确认的幻觉进行错误归因与严重等级标注汇总高频错误模式定位是模型能力问题、知识库缺失问题还是prompt问题步骤5输出测试报告与优化建议报告必须包含整体指标总幻觉率、FactScore、各分类幻觉占比分场景表现业务场景/通用场景/边界场景的幻觉率典型错误案例Top5高频幻觉类型与具体示例优化建议针对高频错误点给出RAG增强、prompt优化、知识库补充等可落地建议五、工程化落地自动化工具链与Skill封装1. 标准工具链组成层级工具选型核心用途用例管理TestLink / 飞书多维表格测试用例版本管理、执行记录追踪模型调用模型官方API / Playwright CLI网页端模型批量调用模型生成回答事实检测LangChain FactScore开源实现原子事实拆解与事实验证知识库企业Wiki / 向量数据库业务事实检索比对报告输出自动化测试平台自动统计指标、生成测试报告2. 可复用测试Skill封装对应你之前的Skill架构将幻觉测试能力原子化封装为标准化Skill实现复用与快速编排skill_llm_call(model, prompt, temperature)统一模型调用参数化控制模型版本与生成参数skill_fact_decompose(text)原子事实拆解Skill输出结构化断言列表skill_fact_verify(claim, knowledge_base)事实验证Skill返回支持/不支持/不确定三态结果skill_hallucination_report()报表生成Skill自动统计指标输出标准化报告3. 测试熔断机制借鉴自动化安全管控思路批量测试内置三级熔断避免资源浪费与无效执行单用例重试单次调用失败自动重试2次连续失败熔断连续10条用例检测为幻觉暂停执行排查模型/知识库故障超时终止单条用例执行超过30秒强制终止避免卡死六、上线验收标准可直接用于项目准入核心准入阈值建议核心业务场景FactScore ≥ 92%核心事实类问题幻觉率 ≤ 5%边界问题拒答准确率 ≥ 90%零P0级严重幻觉核心业务事实错误、虚构法律条文/关键数据分级判定优秀幻觉率3%FactScore95%合格幻觉率3%-8%FactScore 85%-95%不合格幻觉率8%FactScore85%或存在P0级幻觉