← 返回 2026-09-23 简报

Claude Opus 5.5

Claude Opus 5.5

语音播报
摘要
事件:Anthropic发布Claude Opus 5.5,性能对标Fable 5.1且成本降低40%,通过外部安全评估,侧重生物与网络安全防护。 要点:运行成本降40%,输出提速30%以上。自动行为审计得分创纪录,有效抵抗提示注入。缓存读取费用大幅削减60%。 影响:开发者能以更低成本处理复杂代码迁移,提升工作效率。企业用户可更安全地将其应用于生命科学及前沿网络安全研究。

我们推出 Claude Opus 5.5,这是我们要推出的全新 Claude 5.5 系列中的第一款模型。它在大多数任务上的表现达到了 Claude Fable 5.1 的水平,而运行成本比 Opus 5 低 40%。

Claude Opus 5.5 是我们呼吁“放缓前沿发展”以来的首款发布产品。在发布前,它已由包括 Frontier Design 和 METR 在内的外部评估人员进行了测试。在我们执行的自动化行为审计——这是我们所做的最全面的对齐测试中——Opus 5.5 是我们迄今测试过的表现最强的模型。它还配备了我们为最具能力模型开发的安全保障措施。

以下是您从 Opus 5.5 中可以期待的一些改进:

性能。Opus 5.5 相比 Opus 5 是一个巨大的飞跃。它是新的领先模型,早期测试者在处理最复杂的工作时看到了性能的显著提升。一位测试者在不到一天的时间内完成了一项涉及 68 万行代码的迁移工作——这项工作原本需要工程团队花费数周时间。它擅长发现并修复软件中的低效问题:当我们要求它缩短 Web 应用每个页面的加载时间时,Opus 5.5 在 40 次尝试中成功了 39 次,而 Opus 5 虽然也做出了一些改进,但幅度较小且改变了应用的行为。另一位测试者让多个 Claude 模型根据单个提示构建游戏;在图形的强度和打磨程度上,Opus 5.5 的得分高于任何其他模型。

安全。Opus 5.5 在我们自动化行为审计中取得了迄今为止任何模型的最佳分数,该审计是我们用于在数千个模拟场景中测试 Claude 的对齐套件。与最近的模型相比,它采取难以逆转的行动或超出给定边界行事的可能性要小得多,并且比 Opus 5 更能抵抗提示注入。我们还扩大了对齐测试的范围,以涵盖更长的任务、不可能的任务以及基于真实事件构建的场景,尽管它仍有局限性。我们评估的详细信息可在 Opus 5.5 System Card 中找到。

由于 Opus 5.5 在生物学和网络安全方面的能力与 Claude Mythos 5.1 相当,因此我们将其部署时采用了与 Claude Fable 5.1 类似的安全保障措施。经过验证的组织今天可以申请我们的生命科学验证计划(Life Sciences Verification Program),以使用 Opus 5.5 进行生物学研究。在未来几周内,我们还将扩大对网络安全验证计划(Cyber Verification Program)的访问权限,经认证的网络安全从业者将能够将其用于工作。

成本与速度。Opus 5.5 提供服务所需的计算资源少于 Opus 5,其定价也反映了这一点。我们的测试显示,在默认设置下,它在典型负载下的成本比 Opus 5 低 40%。输入和输出令牌的价格分别为每百万个 4 美元和 20 美元,比 Opus 5 低 20%。缓存读取(占代理和编码工作成本的大部分)为每百万个令牌 0.20 美元,比 Opus 5 低 60%。Opus 5.5 的输出生成速度也比 Opus 5 快 30% 以上。

除了降价之外,我们还提高了 Pro、Max、Team 以及按席位计费的 Enterprise 计划的五小时使用限制。我们还在为订阅用户提供速率限制重置功能,您现在可以保存并在任何时候使用它。

沟通。Opus 5.5 的沟通方式比之前的模型更自然。早期测试者发现它的写作更清晰、更容易理解,这解决了一些关于 Opus 5 的常见反馈。它将最重要的信息放在前面,其风格使其在长时间会话中成为更好的工作伙伴。正如一位早期测试者所说:“它写得就像我写的一样。”在我们自己的使用中,这使得 Opus 5.5 的工作成果更易于理解和检查——这既是一个实际好处,也是一个安全优势。

Claude Sonnet 5.5 和 Claude Haiku 5.5 将在未来几周内推出,同样带来许多在性能、效率和安全性方面的改进。

性能与成本效益

在我们的基准测试中,Claude Opus 5.5 在代理式编程、计算机使用和知识工作方面领先。话虽如此,在这些能力水平上,我们发现基准测试的差距已成为衡量现实世界差异的较不可靠指标。在我们自身的使用中,Opus 5.5 与 Claude Fable 5.1 之间的差距比这些分数所显示的要小。

Opus 5.5 Fable 5.1 Opus 5 GPT-6 Astra GPT-5.6 Sol

代理式编程 Terminal-Bench 4.0¹

代理式编程 Terminal-Bench 4.0¹ 66.4% 55.8% 52.3% 57.9% 37.3%

代理式编程 FrontierCode v1.1 (Main)

代理式编程 FrontierCode v1.1 (Main) 54.4% 50.3% 48.0% 53.3% 47.5%

代理式编程 CursorBench 4.0

代理式编程 CursorBench 4.0 57.8% 51.8% 46.6% — 41.7%

知识工作 GDPval-AA v2.1

知识工作 GDPval-AA v2.1 1846 1735 1708 1542 1588

业务流程 AutomationBench²

业务流程 AutomationBench² 40.0% 31.4% 26.9% 41.4% 28.8%

多学科推理 Humanity's Last Exam

多学科推理 Humanity's Last Exam 使用工具时 67.7% 使用工具时 65.6% 使用工具时 63.6% 使用工具时 57.2% —

代理式科学研究 Terminal-Bench-Science 0.1³

代理式科学研究 Terminal-Bench-Science 0.1³ 58.7% 52.6% 29.0% 64.6% 22.4%

计算机使用 OSWorld 2.0

计算机使用 OSWorld 2.0 部分完成 81.8% 部分完成 80.7% 部分完成 74.0% — —

视觉图表识别 Chartography

视觉图表识别 Chartography 使用工具时 89.0% 使用工具时 88.4% 使用工具时 83.4% — —

除非另有说明,所有 Claude Opus 5.5 的结果均使用最大努力的自适应思维。Terminal-Bench 4.0 的结果报告的是 Claude Opus 5.5 在 xhigh 努力水平下以及 GPT-6 Astra 在高努力水平下的表现,数据由 OpenAI 提供;这些代表了每个模型的最高得分。Claude Opus 5.5 的评估启用了其生产环境中的安全限制。当安全限制介入时,网络安全任务由 Claude Opus 4.8 完成,而生物学和前沿大语言模型开发任务则由 Claude Opus 5 完成。这可能会降低 Claude Opus 5.5 在这些基准测试中的表现。

1 Terminal-Bench 4.0:Claude Opus 5.5 的标准误差为 ±2.6 分,其他 Claude 模型的标准误差为 ±1.6–2 分。公共排行榜(每项任务 5 次试验,使用 Claude Code 框架)报告 Claude Opus 5 得分为 51.8%;我们的设置复现结果为 52.3%,在噪声范围内。GPT-6 Astra 和 GPT-5.6 Sol 的数据由 OpenAI 提供。

2 AutomationBench:AutomationBench 的结果由 Zapier 运行并报告。这些运行未使用备用模型,因此安全限制介入被视为失败——这导致得分低于 Claude Opus 5.5 在实际操作中的表现。Claude Opus 5.5 的结果来自 Zapier 在早期访问期间的自身评估。Opus 5、GPT-5.6 Sol 和 GPT-6 Astra 的结果来自 Zapier 的公共排行榜。

3 Terminal-Bench-Science 0.1:每个模型的标准误差为 ±3.5–5 分。公共排行榜(每项任务 3 次试验,使用 Claude Code 框架)报告 Claude Opus 5 得分为 30.0%;我们的设置复现结果为 29.0%,在噪声范围内。GPT-6 Astra 的数据由 OpenAI 提供。

Opus 5.5 优势非常明显的地方在于效率。它的每 token 成本低于 Opus 5,且每项任务使用的 token 更少,最终导致成本降低 40%。

定价

每百万 token 价格 Claude Opus 5.5 Claude Opus 5

缓存读取 $0.20 $0.50

输入 token $4 $5

输出 token $20 $25

缓存写入 $5 $6.25

Opus 5.5 的快速模式也可在 Claude Code 和 Claude Platform 中使用,速度最高可达 2.5 倍。其价格为每百万输入 token 8 美元,每百万输出 token 40 美元。

编程

Opus 5.5 在处理代码库范围迁移和审计等漫长且复杂的任务方面表现尤为出色。一位早期测试者使用它在不到三小时内完成了一个包含 20 万行代码的代码库的审计与修复工作,而 Opus 5 则花费了超过 20 小时,并消耗了 2.5 倍的 token 数量。在一次内部测试中,我们要求 Opus 5.5 和 Fable 5.1 将广泛用于平衡服务器间网络流量负载的 HAProxy 软件从 C 语言重写为 Rust 语言。两者的重写版本都通过了 HAProxy 自身几乎所有的回归测试,但 Opus 5.5 仅用时 9.5 小时,而 Fable 5.1 耗时 12 小时,且成本降低了 51%。

Opus 5.5 以极低的成本在代理式编码领域实现了前沿水平的成果。在 FrontierCode 的默认努力级别下,它以每项任务约 20% 的成本超越了 GPT-6 Astra。在 Terminal Bench 4.0 上,它仅以约 40% 的成本就达到了与 Astra 相当的水平,而在 CursorBench 上,它以约三分之一的成本比 GPT-5.6 Sol 高出 11 分。

代理式终端编码 代理式编码:FrontierCode 代理式编码:CursorBench

代理式终端编码 代理式编码:FrontierCode 代理式编码:CursorBench

Terminal-Bench 4.0 准确率与成本 Opus 5.5

Fable 5.1

Opus 5

GPT-6 Astra

GPT-5.6 Sol

0 10 20 30 40 50 60 70 得分 (%) 2 5 10 20 每次尝试的成本 (美元,对数刻度) 低 中 高 极高 最高

FrontierCode v1.1,主数据集 准确率与成本 Opus 5.5

Fable 5.1

Opus 5

GPT-6 Astra

GPT-5.6 Sol

35 40 45 50 55 0 得分 (%) 0.50 1 2 5 10 每项任务的成本 (美元,对数刻度) 低 中 高 极高 最高

CursorBench 4.0 准确率与成本 Opus 5.5

Fable 5.1

Opus 5

GPT-5.6 Sol

25 30 35 40 45 50 55 60 0 得分 (%) 1 2 5 10 20 每项任务的成本 (美元,对数刻度) 低 中 高 极高 最高

我们的早期测试者报告了类似的效率和智能提升:

GitHub Clio Lovable Quantium Spotify Optiver Column Kiro

GitHub Clio Lovable Quantium Spotify Optiver Column Kiro

引语 “开发者希望代理能够承担实际的软件开发工作并完成它。在我们在 GitHub Copilot CLI 和 VS Code 中的测试中,Claude Opus 5.5 使用的 token 数量和步骤数量都是我们测量中最少的之一。在 VS Code 中,它在不到一半的步骤内解决了比 Opus 5 更多的终端任务。这不仅仅是让单个任务更高效,而是让开发者的更大项目变得更具可行性。”

公司 GitHub

作者 Mario Rodriguez,首席产品官

引语 “我将一个跨越我们六个仓库的大型工程任务交给 Claude Opus 5.5,并让它整夜无人值守地运行。它在超过 18 小时内一直专注于定义我们的服务如何相互通信,并确定每个服务应如何应用这些规则。与 Opus 5 相比,它更快地达到里程碑,且需要极少返工。它的代码注释简短且有用,而不是冗长且充满散文式描述。我很难找到任何负面的评价。”

公司 Clio

作者 Sean Heintz,高级软件开发者

引语 “对于 Lovable 的构建者来说,Opus 5.5 意味着在保持相同质量的同时实现更快的构建,无论是从头开始还是处理实时应用。它一次性收集上下文,进行更少但更完整的编辑,并且不会卡在重试循环中,完成的步骤数减少三分之一到一半,同时显著减少了 token 的使用量。”

公司 Lovable

作者 Fabian Hedin,首席技术官兼联合创始人

引语 “我们在聊天、协作和 Claude Code 等我们团队使用的全部工作范围内测试了 Claude Opus 5.5。一个以前需要四天时间、38 个提示的复杂编码任务,现在仅需三个小时、11 个提示即可完成,且输出更具生产就绪性,返工更少。对于我们团队快速解决复杂问题而言,这意味着更少的迭代时间和更多的质疑时间:测试假设、对输出进行压力测试,并为我们的客户找到最佳解决方案。”

公司 Quantium

作者 Harley Barnes,AI 技术执行经理

引语 “通过 Claude Opus 5.5,我们在内部评估中看到了 token 效率的明显提升,因为我们能够以更低的成本和更快的速度完成相同的任务。”

公司 Spotify

作者 Aleksandar Mitic,高级工程师

引语:“我们在真实的工程和交易台工作中测试模型。在代理编程任务中,Claude Opus 5.5 以大约一半的交互轮次、时间和输出令牌,达到了与 Opus 5 相当的质量,将该工作负载的成本降低了 40% 到 50%。它在一家交易台的交易支持套件上创下了我们记录的最高分数,完成了此前 Claude 模型未能通过的任务,并在我们的分析任务中位列所有八个模型之首。”

公司:Optiver

作者:Noyan Tokgozoglu,全球 AI 工程负责人

引语:“Claude Opus 5.5 在委派子代理方面更加高效,并以创造性的方式检查自己的工作。设置自我验证循环变得更加容易。它在我们之前的账单中发现了以前模型遗漏的节省机会,并在代码审查中通过检查我们早期几次提交中建模错误的第三方集成的外部文档,发现了一个漏洞。”

公司:Column

作者:Mitch Fierro,工程部门

引语:“代理发出的每一次调用都是开发者所感受到的时间和成本。在真实命令行任务的一个公开基准测试中,Claude Opus 5.5 解决了比 Opus 5 更多的任务,同时调用的次数减少了约 40%,使用的令牌量减半。对于使用 Kiro 进行开发的开发者来说,这意味着无论是常规任务还是复杂挑战,代理会话都更快、更经济。Opus 5.5 即将在 Kiro 中可用。”

公司:Kiro

作者:Deepak Singh,代理 AI 副总裁

最安全的编码代理

在企业系统中使用代理的组织需要确保这些代理按预期运行,特别是当它们自主运行数小时时。Opus 5.5 拥有一个分类器,可在每次操作运行前对其进行筛选;一个可供安全团队审计的开源沙箱;以及能在漏洞合并前捕获它们的代码审查功能。

模型本身也具备更强的防御能力。在提示注入攻击方面,它在我们要测试的所有场景(包括编程、工具使用、计算机使用和网页浏览)中均持平或优于 Opus 5。在 AI 安全公司 Gray Swan 运行的基准测试中,Opus 5.5 与 Fable 5.1 并列,成为所有被测试模型中提示注入成功率最低的模型。

知识工作

Opus 5.5 是一位可靠且熟练的研究员。在一次内部测试中,我们要求 Opus 5.5、Fable 5.1 和 Opus 5 仅利用它们能在一份难以定位盈利报告的网页副本上找到的信息,撰写一份关于某公司季度业绩的报告。自动评分器将每个数据和引文与来源进行了核对。在不同的努力设置下,Opus 5.5 的 18 份报告中有 16 份达到了我们的质量门槛,而任何虚构的数据或引文都会导致失败。Fable 5.1 和 Opus 5 在任何尝试中均未达到该门槛。

它在财务分析和商业工作中也表现出色。投资公司 Walleye Capital(早期测试者)报告称,Opus 5.5 在其最低设置下基本解决了他们的评估套件;在更高设置下,其表现甚至更好,注意到了他们评估指令中的错误并进行了修正。此前没有其他模型发现过这一错误。

在另一项测试中,我们要求 Opus 5.5 和 Opus 5 分析两家虚构的人力资源软件公司之间的拟议合并。两者都在 Excel 中构建了财务模型,然后将其转化为关于该交易在其价格下是否合理的执行层演示文稿。两个模型对交易的结论相同,但 Opus 5.5 的模型更加详尽,其演示文稿也更容易阅读,而 Opus 5 的模型存在细微错误。Opus 5.5 耗时 63 分钟完成,而 Opus 5 耗时 93 分钟,且成本降低了 50%。

在知识工作评估中,Opus 5.5 在表现优于其他模型的同时,使用的令牌也更少。在 GDPval-AA v2.1(一项涵盖 44 种职业的真实工作测试)中,Opus 5.5 获得了 1846 Elo 的分数,领先于 Fable 5.1 和 Opus 5。在默认努力设置(中等)下,Opus 5.5 以每任务约五分之一的成本,在最大努力下击败了 GPT-6 Astra。它同样在其他衡量业务流程和大规模数据收集的基准测试中表现优于其他模型。

GDPval-AA v2.1 AutomationBench WANDR

GDPval-AA v2.1 AutomationBench WANDR

GDPval-AA v2.1 Elo 与成本 Opus 5.5

Fable 5.1

Opus 5

GPT-6 Astra

GPT-5.6 Sol

1200 1300 1400 1500 1600 1700 1800 0 Elo 0.20 0.50 1 2 5 10 每项任务预估成本(美元,对数刻度)低 中 高 极高 最高

AutomationBench 准确率与成本 Opus 5.5

Opus 5

GPT-6 Astra

GPT-5.6 Sol

0 10 20 30 40 通过率(%)0.50 1 2 每项任务成本(美元,对数刻度)低 中 高 极高 最高

WANDR 准确率与成本 30 40 50 60 70 0 得分(%)1 2 5 10 20 50 每次尝试成本(美元,对数刻度)低 中 高 极高 最高

我们的客户报告了类似的结果。以下是他们关于使用该模型的工作反馈:

德勤咨询 LLP Rogo LexisNexis Legal & Professional Walleye Capital Hex Thomson Reuters Labs Hebbia Viktor

德勤咨询 LLP Ro

本条评分 10.2 score-v1
  • 来源权威 7
    注册表 priority=7(Hacker News)
  • 时效 2.671
    发布 6.0 小时前,衰减到 2.67/3.0
  • 多源印证 0.5
    2 家不同来源在报同一件事,+0.50
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-23 · 10.17 分

原文链接:https://www.anthropic.com/claude-opus-5-5
来源:Hacker News
以上内容由 AI 自动翻译,仅供参考。
← 返回简报