人工智能对齐研究面临一个基本问题:应以谁的道德期望为指导?通常假设以人类行为为基准,但研究表明人们并不总是同等判断人类和AI。本文进一步探讨:当AI的人类起源显现时,评估是否变化;以及人们是否对编程AI的人类有不同评价。实验采用失控矿车场景,对1002名美国成年人进行四种条件下的道德判断测量:修理工、修理机器人、由公司工程师编程的修理机器人、编程工程师。结果显示,修理工与机器人评价无显著差异,但当机器人行为被描述为人类设计时,判断显著变化;参与者对编程机器人或工程师表现出更强的道义论推理。这表明人类、AI系统及其设计者可能受到不同标准评判,引发“对齐目标问题”:在高风险领域应以何种规范目标引导人工道德主体发展,以及这些多元判断能否在价值对齐的统一框架内协调。

核心观点

技术要点

实验采用失控矿车场景,设置四种条件(修理工、修理机器人、公司工程师编程的修理机器人、编程工程师),测量1002名美国成年人的道德判断,分析道义论与功利主义倾向的差异。

应用场景

高风险AI决策领域(如自动驾驶、医疗、军事)的价值对齐,以及AI系统设计时需考虑人类对设计者的道德评估。