用 意义熵 精准捕捉LLM的胡言乱语:缺点浪费资源

发布时间:2026/7/21 4:13:43

用 意义熵 精准捕捉LLM的胡言乱语:缺点浪费资源 深度解析:Semantic Entropy —— 用"意义熵"检测 LLM 的胡编乱造目录深度解析:Semantic Entropy —— 用"意义熵"检测 LLM 的胡编乱造一、论文档案二、术语精修:Confabulation ≠ 所有幻觉三、核心洞察:Naive Entropy 为什么失效四、方法总览(Fig. 1 结构复述)Fig. 1 — Overview of semantic entropy and confabulation detectionFig. 1a:短答案场景(QA/单事实)Fig. 1b:长答案场景(段落级)五、方法的三步走(含关键工程细节)Step 1:Sample —— 对同一个 prompt 采样 M 个答案Step 2:Cluster —— 用双向蕴含(Bi-directional Entailment)聚类Step 3:Entropy —— 在语义 cluster 上计算熵六、Fig. 2 详解:短答案 QA 的实验结果Fig. 2 图结构(原图为柱状图组)实验设置关键结果七、Fig. 3 详解:GPT-4 传记级长文本实验设置Fig. 3 图注原文翻译关键结果八、两个关键评估指标(业内不常见但极为重要)AUROC(Area Under ROC Curve)AURAC(Area Under Rejection-Accuracy Curve)⭐ 论文新提九、论文的诚实边界(学术论文难得的坦诚)十、对工业落地的意义(结合工单分类项目)十一、原论文图片直接访问链接十二、一句话总结一、论文档案项内容标题Detecting hallucinations in large language models using semantic entropy作者Sebastian Farquhar¹ ², Jannik Kossen¹ ², Lorenz Kuhn¹ ², Yarin Gal¹所属牛津大学 OATML(Oxford Applied and Theoretical Machine Learning)发表Nature, vol. 630, no. 8017, pp. 625–630, June 2024DOI

相关新闻