本文探讨了人工智能对齐中的目标问题:人类、AI系统及其设计者如何被不同地道德评价。实验表明,当AI行为被明确为人类设计时,人们更倾向于基于规则的道德推理,揭示了价值对齐中的多元判断挑战。

核心观点

技术要点

采用了失控矿车场景的道德判断实验,涉及四种条件(修理工、修理机器人、编程的机器人、编程工程师),通过对比分析揭示了人类代理可见性对道德推理的影响。

应用场景

应用于自主系统的价值观对齐、AI伦理设计、AI责任归属的政策制定。