随着大语言模型在复杂高风险决策场景中的部署增加,必须使其推理基于因果关系而非虚假相关性。然而,传统推理基准上的高性能并不能保证真正的因果推理能力,因为高准确率可能源于记忆语义模式而非分析潜在因果结构。为弥补这一关键差距,我们提出了一个新的因果推理基准CausalFlip,旨在鼓励开发新的LLM范式或训练算法,使LLM的推理基于因果关系而非语义相关性。CausalFlip包含基于事件三元组构建的因果判断问题,这些三元组可形成不同的混淆、链和碰撞关系。在此基础上,为每个事件三元组构建语义相似但因果答案相反的问题对,依赖语义匹配的模型会被系统性地引导至错误预测。为进一步探测模型对语义模式的依赖,我们引入了噪声前缀评估,在中间因果推理步骤前添加因果无关文本,而不改变潜在因果关系或推理逻辑。我们在多种训练范式下评估LLM,包括仅答案训练、显式思维链监督以及一种旨在减轻推理过程中对相关性显式依赖的内化因果推理方法。结果表明,显式思维链仍可能被虚假语义相关性误导,而内化推理步骤则显著提升了因果基础,表明更好地激发基础LLM的潜在因果推理能力是可行的。
核心观点
- 提出因果推理基准CausalFlip,关注超越语义匹配的因果判断。
- 基于事件三元组构建混淆、链和碰撞关系的问题对,语义相似但答案相反。
- 引入噪声前缀评估,在推理步骤前添加无关文本以测试语义依赖。
- 比较三种训练范式:仅答案训练、显式思维链监督和内化因果推理。
- 实验发现显式思维链易被误导,内化推理显著改善因果基础。
技术要点
CausalFlip基准通过构造语义相似但因果答案相反的问题对,以及噪声前缀评估,系统性地测试LLM是否依赖语义匹配进行因果推理。内化因果推理方法通过隐式化推理步骤来减少对显式相关性的依赖。
应用场景
用于评估和提升大语言模型在医疗诊断、法律判断、科学发现等高风险决策场景中的因果推理能力。