该研究探讨了人工智能对齐中的一个基本问题:应该以谁的道德期望来指导AI决策?传统对齐研究常假设人类自身的行为是基准,但研究表明人们对人类和AI的判断并不总是一致的。本文通过实验(1002名美国成年人)在一个失控矿车场景中,比较了对修理工、修理机器人、由工程师编程的机器人以及编程工程师的道德判断。结果发现,当机器人的行为被描述为人类设计产物时,人们的判断显著改变,表现出更强的道义论推理。这揭示了“对齐目标问题”:在高风险领域中,应以哪个规范目标来指导人工道德代理的开发,以及这些多元判断能否在价值对齐中协调一致。

核心观点

技术要点

研究采用失控矿车场景,设计四种条件(修理工、修理机器人、工程师编程的机器人、编程工程师),通过在线实验测量道德判断。使用统计方法比较不同条件下的道义论与功利主义倾向,发现人类设计参与会激活更强的规则约束。

应用场景

该研究可应用于自动驾驶、医疗决策、军事AI等高风险领域的价值对齐设计,帮助识别不同利益相关者(用户、设计师、监管者)的道德预期差异。