← 返回 2026-09-23 简报

Claude Opus 5.5 在更低成本下实现与 Fable 5.1 相当的性能,并有望减少“类克劳德式”文风

Claude Opus 5.5 matches Fable 5.1 performance at lower cost and promises less "Claudish" writing

语音播报
摘要
事件:Anthropic发布Claude Opus 5.5,宣称其性能匹敌Fable 5.1,成本降低40%且速度提升30%。 要点:输入输出单价分别降至4美元和20美元,缓存读取成本削减60%。 影响:大幅降低企业部署成本,提升开发者使用效率。新增防蒸馏机制与生物安全限制,推动行业关注模型对齐与安全标准。

Anthropic正在推出Claude Opus 5.5,这是新系列中的首款模型。该公司表示,该模型在提供与Claude Fable 5.1相当的性能的同时,成本显著更低,运行速度也更快。

据Anthropic称,Opus 5.5在“大多数任务”上与Claude Fable 5.1持平,而运行成本比Opus 5低约40%。Claude Sonnet 5.5和Haiku 5.5预计将在未来几周内推出,同样在性能、效率和安全性方面有所提升。Anthropic的基准测试显示,新款Opus模型在大多数任务上领先于Fable 5.1以及OpenAI成本高昂得多的GPT-6 Astra。

基准/能力
Opus 5.5
Fable 5.1
Opus 5
GPT-6 Astra
GPT-5.6 Sol

代理式编码

Terminal-Bench 4.0[1]
66.4%
55.8%
52.3%
57.9%
37.3%

代理式编码

FrontierCode v1.1 (Main)
54.4%
50.3%
48.0%
53.3%
47.5%

代理式编码

CursorBench 4.0
57.8%
51.8%
46.6%
N/A
41.7%

知识工作

GDPval-AA v2.1
1,846
1,735
1,708
1,542
1,588

业务流程

AutomationBench[1]
40.0%
31.4%
26.9%
41.4%
28.8%

多学科推理

Humanity's Last Exam
67.7%

(带工具)
65.6%

(带工具)
63.6%

(带工具)
57.2%

(带工具)
N/A

代理式科学研究

Terminal-Bench-Science 0.1[1]
58.7%
52.6%
29.0%
64.6%
22.4%

计算机使用

OSWorld 2.0
81.8%

(部分)
80.7%

(部分)
74.0%

(部分)
N/A
N/A

视觉图表识别

Chartography
89.0%

(带工具)
88.4%

(带工具)
83.4%

(带工具)
N/A
N/A

Anthropic表示,新系列主要解决客户在成本、效率和沟通质量方面的反馈,特别是在金融服务、法律和软件开发领域。

降低价格和令牌用量以削减运营成本

Anthropic将Opus 5.5的定价定为每百万输入令牌4美元,每百万输出令牌20美元,而Opus 5的价格分别为5美元和25美元。这意味着令牌价格降低了20%。该公司还将缓存读取成本降低了60%。

Anthropic表示,总运营成本(包括令牌价格和令牌用量)应比Opus 5低约40%。该模型使用的令牌更少,生成输出的速度提高了30%以上。

每百万令牌的单价
Claude Opus 5.5
Claude Opus 5

缓存读取
$0.20
$0.50

输入令牌
$4
$5

输出令牌
$20
$25

缓存写入
$5
$6.25

订阅者的五小时使用限制将增加20%。随着成本的降低,Anthropic表示这些限制总体上延长了25%。用户还可以保留一次限制重置,以备急需之时。

Anthropic正利用编码基准测试来证明其价格与性能的优势。在FrontierCode上,该公司表示Opus 5.5以约20%的任务成本击败了OpenAI的GPT-6 Astra。在Terminal-Bench 4.0上,它声称以40%的成本实现了与Astra相同的性能。在CursorBench上,它表示Opus 5.5以三分之一的成本比GPT-5.6 Sol高出11分。

这次降价是对来自OpenAI以及尤其是中国AI模型压力的回应,后者提供的性能较低,但成本仅为前者的零头。

Anthropic承诺减少“Claude味”

Opus 5.5还被设计为比早期模型沟通更自然。Anthropic表示,它将最重要的信息放在前面,使用较少的行话,并更严格地遵循写作指令。早期测试者形容其写作风格更清晰、更易懂,Anthropic称这使其成为长时间工作会话中更好的合作伙伴。当前的Claude模型因其公式化、晦涩的写作风格而受到大量批评,这种风格有时被称为“Claudish”。

截图来源:PAW
Opus 5.5也是首款在网络安全、生物技术和前沿大语言模型开发方面拥有与Fable 5.1相匹配的安全措施的Opus模型。当这些安全措施触发时,Anthropic表示请求将被透明地路由到其他模型。

用户仍可以在其代码中找到并修复错误,但大多数网络安全任务将交由较旧的Opus 4.8处理。被分类器标记为涉及生物技术或前沿大语言模型开发的请求将交由Opus 5处理。

经核实的组织可以通过生命科学验证计划申请使用该模型进行生物研究。Anthropic 计划在接下来几周内将其现有的网络验证计划扩展至 Opus 5.5。

Claude Opus 5.5 现已在所有平台上提供,包括 Amazon Web Services、Google Cloud 和 Microsoft Azure。使用 Claude Platform 的开发者可以通过模型 ID claude-opus-5-5 访问该模型。

Anthropic 呼吁随着模型能力增强而提高安全标准

Anthropic 计划更严格地筛选强化学习环境。该公司表示,有缺陷的训练环境是导致模型行为偏离对齐的主要来源。该公司还在致力于改进对齐奖励、自动化创建安全训练场景的方法,以及加强安全和监控措施。

AI 实验室正在辩论以多快的速度发布更具能力的模型。OpenAI 最近呼吁为能够自我改进的 AI 系统建立国际标准,而几位研究人员也公开敦促实验室放慢发布速度,直到对齐方法跟上步伐。Anthropic 采取了类似立场,呼吁对可能完全自动化 AI 研究的模型设定更高的安全标准。该公司表示,公共政策应在设定该标准方面发挥更大作用。在 Opus 5.5 发布前,外部组织 Frontier Design 和 METR 对其进行了测试。

新限制措施针对蒸馏攻击并支持欧盟《人工智能法案》合规性

Anthropic 还正在引入针对其所谓“蒸馏攻击”的措施。该公司表示,攻击者利用数千个虚假账户以工业规模提取模型能力,并在没有其安全保护的情况下构建高度强大的模型。Anthropic 引用了一份 2026 年 9 月的威胁报告,记录了其迄今为止已检测并阻止的非法蒸馏活动。

Opus 5.5 发布时带有“保留思维”(Preserved Thinking)功能,这是一种首次随 Fable 5.1 引入的反蒸馏措施。它防止 API 用户编辑 Claude 的先前上下文以提取其推理过程。该措施适用于 2026 年 8 月 31 日或之后创建的 API 账户中的 Fable 5.1 和 Opus 5.5。

Opus 5.5 还包括水印措施,以符合欧盟《人工智能法案》的要求。该模型不再允许在禁用“思维”模式的情况下运行,并且提供零数据保留选项。

Artificial Analysis 将 Opus 5.5 置于其智能指数榜首

独立平台 Artificial Analysis 确认了 Opus 5.5 的强劲表现。在最大努力模式下,该模型在 Artificial Analysis 智能指数中得分 58 分,创下历史新高,比之前的领先者高出数个百分点。它在十项评估中的六项中名列前茅,包括“人类最后一次考试”(Humanity's Last Exam)达到 61.4%(此前最佳:59.1%,Fable 5.1)和 SciCode 达到 66.9%(63.1%,同样为 Fable 5.1)。在 Terminal-Bench 4.0 上,Opus 5.5 得分 59.6%,与 GPT-6 Astra 持平,并比 Opus 5 高出 11 分。

Claude Opus 5.5 以 58 分领先 Artificial Analysis 智能指数,随后是 Claude Fable 5.1 和 GPT-6 Astra,两者均为 53 分。在成本效益图表(底部)中,Opus 5.5 的几个努力水平位于帕累托前沿。| 图片来源:Artificial Analysis

Artificial Analysis 表示,Opus 5.5 使 Anthropic 在 Terminal-Bench 4.0 和 AutomationBench-AA 上与 GPT-6 Astra 持平,同时在代理知识工作方面扩大了领先地位。在私有 AA-Briefcase 基准测试中,Opus 5.5 达到 1,822 的 Elo 分数,比 Fable 5.1 高出 143 分,这是 Anthropic 模型首次在呈现质量上击败 GPT-5.6 Sol。在 GDPval-AA(一个针对现实世界白领工作的 OpenAI 基准测试)中,Opus 5.5 在所有推理模式下均优于 Astra,除了低努力模式。

在GDPval-AA v2.1上,Claude Opus 5.5在几乎所有努力层级下,以相当或更低的任务成本获得了比竞争对手更高的Elo得分。仅在“低”设置下,Astra的表现略胜一筹。| 图片来源:Anthropic

Artificial Analysis确实指出存在效率上的权衡。在最大努力层级下,Opus 5.5每个任务消耗约119,000个输出令牌,远高于Opus 5(73,000)、Fable 5.1(78,000)或GPT-6 Astra(27,000)。较低的令牌价格使其每个任务的成本与Opus 5持平,但并未更便宜。然而,五个Opus 5.5努力层级中有四个位于帕累托前沿,在任务成本指数超过50的范围内,其表现匹配或优于其他所有模型。

没有炒作成分的AI新闻 – 由人工策划

订阅THE DECODER,享受无广告阅读、每周AI通讯、每年六次的独家“AI雷达”前沿报告、完整档案访问权限以及评论板块的参与资格。

立即订阅

本条评分 11.2 score-v1
  • 来源权威 8
    注册表 priority=8(The Decoder)
  • 时效 2.708
    发布 5.3 小时前,衰减到 2.71/3.0
  • 多源印证 0.5
    2 家不同来源在报同一件事,+0.50
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-23 · 11.21 分

原文链接:https://the-decoder.com/claude-opus-5-5-matches-fable-5-1-at-40-percent-lower-cost-as-anthropic-promises-to-fix-claudish-writing/
来源:The Decoder
以上内容由 AI 自动翻译,仅供参考。
← 返回简报