STaR: Towards Cognitive Table Reasoning via Slow-Thinking Large Language Models
📅 2026/7/21 23:43:00
👁️ 阅读次数
📝 编程学习
STaR 论文总结与核心内容翻译
一、文章主要内容
本文针对大型语言模型(LLMs)在表格推理任务中存在的推理深度不足、过程不稳定两大核心问题,提出了名为STaR(Slow-Thinking for Table Reasoning)的认知型表格推理框架。该框架通过模拟人类"慢思考"过程,让LLMs具备逐步推理能力和轨迹级不确定性感知,从而提升表格推理的准确性、稳定性和泛化性。
核心技术架构
- 慢思考数据集构建:基于WikiTableQuestions、HiTab、FinQA等数据集,通过答案感知生成和自我验证机制,构建高质量训练数据,确保推理轨迹与最终答案一致,过滤模糊或错误样本。
- 两阶段难度感知强化学习(DRL):
- 阶段1(基础训练):使用简单样本快速建立基础推理模式,采用高学习率实现快速收敛;
- 阶段2(进阶训练):针对复杂样本,通过动态样本过滤和改进的GRPO(增强型群体相对策略优化)算法,聚焦模型当前能力范围内的困难任务,避免资源浪费。
- 轨迹级不确定性量化(UQ):融合令牌级置信度(对数概率、熵)和答案一致性,通过加权融合策略从多个推理轨迹中选择最可信路径,将潜在的pass@k性能转化为可靠的pass@1性能。
实验与效果
在WTQ、HiTab、FinQA等域内基准数据集和Ta
编程学习
技术分享
实战经验