本文探讨了人工智能对齐中的目标问题:人类、AI系统及其设计者如何被不同地道德评价。实验表明,当AI行为被明确为人类设计时,人们更倾向于基于规则的道德推理,揭示了价值对齐中的多元判断挑战。
核心观点
- 对齐研究常假设以人类行为为基准,但人们并不总是等同评价人类和AI。
- 实验发现,当AI行为被归因于人类设计时,道德判断更偏向义务论。
- 对AI、人类和设计者的评价存在显著差异,产生对齐目标问题。
- 需要明确在高风险领域应以何种规范目标指导AI发展。
技术要点
采用了失控矿车场景的道德判断实验,涉及四种条件(修理工、修理机器人、编程的机器人、编程工程师),通过对比分析揭示了人类代理可见性对道德推理的影响。
应用场景
应用于自主系统的价值观对齐、AI伦理设计、AI责任归属的政策制定。