随着大型语言模型(LLM)在复杂高风险决策场景中的部署日益增多,必须将其推理建立在因果关系而非虚假相关性之上。然而,传统推理基准上的强性能并不能保证真正的因果推理能力,因为高准确率可能源于记忆语义模式而非分析潜在因果结构。为弥补这一关键差距,我们提出了新的因果推理基准CausalFlip,旨在鼓励开发新的LLM范式或训练算法,使其推理基于因果关系而非语义相关性。CausalFlip由基于事件三元组的因果判断问题组成,这些三元组可形成不同的混杂、链和碰撞关系。在此基础上,为每个事件三元组构建语义相似但因果答案相反的问题对,使得依赖语义匹配的模型系统性地走向错误预测。为进一步探测模型对语义模式的依赖,我们引入了噪声前缀评估,在不改变潜在因果关系和推理逻辑的前提下,在中间因果推理步骤前添加因果无关文本。我们评估了多种训练范式下的LLM,包括仅答案训练、显式思维链(CoT)监督以及一种内化因果推理方法,旨在减少推理过程中对外部相关性的显式依赖。结果表明,显式CoT仍可能被虚假语义相关性误导,而内化推理步骤显著提升了因果基础,表明更好地激发基础LLM的潜在因果推理能力是可行的。
核心观点
- CausalFlip基准专门设计用于测试LLM的因果推理能力,而非语义匹配能力。
- 通过构建语义相似但答案相反的问题对,暴露模型依赖语义相关性的缺陷。
- 引入噪声前缀评估进一步探测模型对语义模式的依赖。
- 提出内化因果推理方法,减少显式依赖相关性,提升因果基础。
技术要点
CausalFlip基准基于事件三元组构建因果判断问题,涵盖混杂、链和碰撞三种因果结构。为每个三元组生成语义相似但因果答案相反的问题对,并采用噪声前缀评估方法,在推理步骤前插入因果无关文本以测试模型鲁棒性。评估涵盖多种训练范式:仅答案训练、显式CoT监督、以及内化因果推理方法。
应用场景
适用于高风险决策场景(如医疗、金融、法律)中需要因果推理的LLM评估和改进,也可用于训练因果导向的LLM范式或算法。