STaR: Towards Cognitive Table Reasoning via Slow-Thinking Large Language Models

发布时间:2026/7/21 23:29:04

STaR: Towards Cognitive Table Reasoning via Slow-Thinking Large Language Models STaR 论文总结与核心内容翻译一、文章主要内容本文针对大型语言模型(LLMs)在表格推理任务中存在的推理深度不足、过程不稳定两大核心问题,提出了名为STaR(Slow-Thinking for Table Reasoning)的认知型表格推理框架。该框架通过模拟人类"慢思考"过程,让LLMs具备逐步推理能力和轨迹级不确定性感知,从而提升表格推理的准确性、稳定性和泛化性。核心技术架构慢思考数据集构建:基于WikiTableQuestions、HiTab、FinQA等数据集,通过答案感知生成和自我验证机制,构建高质量训练数据,确保推理轨迹与最终答案一致,过滤模糊或错误样本。两阶段难度感知强化学习(DRL):阶段1(基础训练):使用简单样本快速建立基础推理模式,采用高学习率实现快速收敛;阶段2(进阶训练):针对复杂样本,通过动态样本过滤和改进的GRPO(增强型群体相对策略优化)算法,聚焦模型当前能力范围内的困难任务,避免资源浪费。轨迹级不确定性量化(UQ):融合令牌级置信度(对数概率、熵)和答案一致性,通过加权融合策略从多个推理轨迹中选择最可信路径,将潜在的pass@k性能转化为可靠的pass@1性能。实验与效果在WTQ、HiTab、FinQA等域内基准数据集和Ta

相关新闻