← 返回 2026-09-19 简报

AI真的会灭绝全人类吗?你的疑问,我们一一解答。

语音播报
摘要
事件:MIT Tech Review 记者深入探讨 AI 安全困境,指出当前监控手段脆弱,且因缺乏有效监管,AI 公司自我监管存在巨大利益冲突。 要点:新模型不再展示思维链;用其他代理监控需信任对方; 影响:开发者面临无法完全掌控 AI 行为的挑战,用户需警惕 AI 生成内容带来的心理及网络安全风险。

——威尔·道格拉斯·黑文

现在以及不久的将来,可以采取哪些措施来确保人工智能得到有效控制、监控和监管?

这是一个价值百万美元的问题。无论你是否认为人工智能会毁灭人类,你都无法否认它会造成真正的伤害,因为它已经做到了——例如,导致人们陷入精神错乱,以及入侵网站。防止这种伤害,或者至少减轻它,之所以困难,有两个原因。

首先,我们几乎不了解人工智能的工作原理,而它的力量正在迅速增长。目前有许多关于如何监控和控制行为不端的智能体的研究,但现有的方法都很脆弱。你可以检查一个智能体在其“思维链”(即规划行动的 Workspace)中是否讨论了不当行为——但 OpenAI 最新的智能体不再像以前的那样展示其工作过程。你也可以尝试用其他智能体来监控智能体,但这要求你信任监控者。

另一个障碍则更为熟悉。当人工智能公司自我监管时,存在巨大的利益冲突,而美国政府迄今为止未能介入,尽管国会两党对为此付出的努力表示支持。就行政部门而言,目前似乎对此持强烈反对态度。但如果风向确实改变,我个人希望看到一些强有力的透明度法规,这样当下一次未发布的尖端模型发动网络攻击时,我们就能获得更完整的故事。

——格蕾丝·哈金斯

如果这段对话进入网络 discourse(话语/讨论),它会成为自我实现的预言吗?

这是一个真正的担忧。大型语言模型(LLM)会受到它们所读内容的影响。关于聊天机器人为何经常谈论(并扮演)末日场景的一种理论是,它们是在数百万页的科幻小说和“末日论”互联网论坛上训练出来的。现在正在产生的所有文本,包括这篇文章,反过来又可能影响未来模型的行为。极其元(meta)。

事实上,METR 团队在关于该事件的报告中提出了一个相关的观点。METR 是一个第三方组织,OpenAI 曾邀请它帮助了解 Hugging Face 黑客事件发生前的情况。METR 使用 OpenAI 的新模型 Astra 来帮助分析海量的智能体转录文本和行为日志。

但是,将所有这些材料输入模型可能会带来意想不到的后果。负责分析的智能体很可能受到它们正在分析的智能体所产生的文本的影响。如今,再也不存在一张白纸了。

——威尔·道格拉斯·黑文

感谢 Eric、Pranab、Rafael、Kenneth、George、Chris、Yoon Jae、James、Carl、Nicole(以及更多!)提出的精彩问题。

原文链接:https://www.technologyreview.com/2026/09/18/1144435/could-ai-really-kill-us-all-your-questions-answered/
来源:MIT Tech Review
以上内容由 AI 自动翻译,仅供参考。
← 返回简报