预测人类题目难度对教育评估至关重要,现有方法常依赖昂贵的人工校准或题目文本表示,且缺乏对认知过程的解释。本文提出难度不仅是文本属性,更是题目引发的解题负担的可观察结果。大型推理模型通过推理轨迹提供可扩展的过程证据,但需结构化以支持可解释建模。为此,我们引入Epi2Diff框架,将推理轨迹映射为认知基础的片段序列,通过推理规模、努力分配和状态转换建模难度。Epi2Diff提取紧凑的片段动态特征,结合语义表示进行难度预测。在四个真实数据集上,Epi2Diff持续超越强基线方法,包括微调的小语言模型、大语言模型上下文学习和监督微调。在SAT分类任务上,较监督微调获得8.1%平均相对增益。进一步分析表明,难题引发更费力、迭代和以实现为中心的片段动态,而非仅更长的回答。这些结果证明认知片段为人类题目难度提供了可预测和可解释的过程表示,为教育测量提供了新视角。
核心观点
- 现有难度预测方法成本高且缺乏认知解释,本文提出将难度视为解题负担的可观察结果。
- 利用大型推理模型的推理轨迹,通过Epi2Diff框架映射为认知片段序列进行建模。
- Epi2Diff结合片段动态特征与语义表示,在四个真实数据集上超越多个强基线方法。
- 在SAT分类任务中,Epi2Diff较监督微调基线获得8.1%的平均相对增益。
- 难题的特点是更费力、迭代和实现为中心的片段动态,而非仅更长的回答。
技术要点
Epi2Diff将大型推理模型的推理轨迹映射为认知基础的片段序列,每个片段对应一个功能性的问题解决状态。通过提取紧凑的片段动态特征(如推理规模、努力分配和状态转换),并结合题目的语义表示(如文本嵌入),构建难度预测模型。该方法无需人工标注推理过程,即可从轨迹中自动提取可解释的过程证据。
应用场景
教育评估中的题目难度预测、测试构建、公平性分析,以及通过推理模型理解人类认知过程。