
文章主要内容与创新点总结一、主要内容本文聚焦大型语言模型(LLMs)在自然语言处理(NLP)任务中的变质测试(Metamorphic Testing, MT)研究,核心是解决LLM自动化测试中的“预言机问题”(即缺乏标注数据时难以判断输出正确性)。研究背景:LLMs在NLP任务中应用广泛,但存在偏见、幻觉等错误行为,自动化测试对提升其可靠性至关重要。传统测试依赖人工标注数据,成本高且数量有限,而变质测试通过定义变质关系(MRs),可在无标注数据的情况下检测错误。核心工作:系统梳理文献:检索1024篇论文,筛选出44篇相关研究,整理出191个适用于NLP任务的独特变质关系(MRs),覆盖24类NLP任务。开发测试框架:构建LLMORPH自动化测试框架,实现36个代表性MRs,支持函数式和LLM辅助的输入转换。大规模实验:在GPT-4、LLAMA3、HERMES 2三款LLM上,针对问答、自然语言推理、情感分析、关系抽取4类任务,执行约56万次变质测试。关键发现:变质测试有效:平均故障检测率18%,能发现11%传统标注数据测试遗漏的错误,二者具有互补性。真阳性率稳定:手动验证显示约62%的测试违规为真阳性,假阳性主要源于NLP任务的内在模糊性,与传统NLP变质测试水平相当。MRs特性:部分MRs具有任务