← 返回 2026-09-30 简报

发布 GPT-6.1 Sol

Introducing GPT-6.1 Sol

语音播报
摘要
事件:OpenAI发布GPT-6.1 Sol模型,旨在平衡智能与成本。 要点:DeepSWE测试中匹配Astra性能且成本仅为一/五;缓存输入成本低至每百万token 0.1美元; 影响:大幅降低AI代理开发门槛,使高频复用上下文的复杂工作流更具经济可行性。

GPT-6.1
Sol
在各项任务中更强大的 Sol
编码
专业工作
计算机使用
科学研究
事实准确性
安全部署 GPT-6.1 Sol
定价与可用性
以五分之一价格实现接近 Astra 的智能

我们推出 GPT‑6.1 Sol,这是对 GPT‑6 Sol 的升级,它在智能代理编码、计算机使用和专业工作方面的能力几乎可与 GPT‑6 Astra 媲美,而标准输入和输出令牌的价格仅为 Astra 的五分之一。缓存输入成本仅为每百万令牌 0.10 美元——比标准输入定价低 95%,比 GPT‑6 Sol 的缓存输入定价低 50%——为开发者提供了更多空间来构建和运行能够在请求间复用上下文的强大智能体。

在各项任务中更强大的 Sol

GPT‑6.1 Sol 为重要的日常工作提供了能力与成本的新平衡。它在复杂的专业任务方面相比 GPT‑6 Sol 取得了显著改进,从编写和调试代码到理解文档以及执行多步骤业务流程。在这些评估中的几项上,它以显著更低的成本接近 GPT‑6 Astra 的表现。

编码

在 DeepSWE v1.1(在真实代码库中评估复杂软件工程任务)上,GPT‑6.1 Sol 以约五分之一的成本与 GPT‑6 Astra 持平,同时以更低的推理努力和成本超越了 GPT‑6 Sol 的最高得分 6.4 个百分点。

DeepSWE
GPT-6.1 Sol
GPT-6 Sol
GPT-6 Astra
$0
$2
$4
$6
每个任务的成本
0%
20%
40%
60%
80%
得分
GPT-6.1 Sol
GPT-6 Sol
GPT-6 Astra

在 DeepSWE 1.1(在新窗口中打开)中,AI 智能体解决原创的、长周期的软件工程任务。

专业工作

在 GDP.pdf(衡量模型使用包含表格、图表、示意图和细则细节的复杂 PDF 文档回答专业问题的准确性)上,GPT‑6.1 Sol 在低于一半的任务成本下,以超过 Opus 5.5 的得分领先,涵盖了所有测试的推理设置。它也以约五分之一的任务成本接近 GPT‑6 Astra 的最先进表现。

在 GDP.pdf(在新窗口中打开)中,模型必须回答来自金融、医疗、法律和其他七个专业领域工作流程中提取的真实世界复杂 PDF 提示。

在 AutomationBench(衡量智能体是否正确完成多步骤业务流程)上,GPT‑6.1 Sol 在中度推理努力下比 Opus 5.5 高出 2.2 个百分点,成本约为其三分之一。该得分也比相同设置下的 GPT‑6 Sol 高出 4.8 个百分点。

在 AutomationBench 1.0.6(在新窗口中打开)中,AI 智能体在销售、营销、运营、支持、财务和人力资源方面使用 47 种工具进行端到端工作流程测试。Claude Fable 5.1 的数据点低估了其实际成本,因为它省略了回退的成本,而回退发生在约 40% 的任务中。

计算机使用

GPT‑6.1 Sol 在需要与计算机应用程序交互的任务上也取得了显著进展。在 OSWorld 2.0 的离线集(评估智能体应对高难度计算机使用工作流程的能力)上,GPT‑6.1 Sol 以低于一半的成本,在最大推理努力下比 GPT‑6 Sol 高出七个百分点。它以约七分之一的任务成本,在最大推理努力下距离 Astra 的得分仅差 2.1 个百分点。

在 OSWorld 2.0(在新窗口中打开)中,AI 智能体尝试涵盖日常和专业任务的长周期计算机使用工作流程。我们报告的是 v2026.08.08 版本离线集上的部分奖励。

科学研究

在 Terminal-Bench Science 0.1(评估包括数据分析、仿真和定理证明在内的科学工作流程)上,GPT‑6.1 Sol 以低于一半的任务成本,在最大推理努力下将 GPT‑6 Sol 的得分翻倍以上。在最大努力下,GPT‑6.1 Sol 每个任务的平均成本为 5.47 美元,而 Opus 5.5 为 23.21 美元,Astra 为 23.80 美元,以比这两种模型低超过 75% 的成本提供显著的科学能力。

在测试的模型中,GPT‑6 Astra 仍以 68.1% 的最高得分位居榜首,适用于最具挑战性的科学研究任务。

在 Terminal-Bench Science 0.1(在新窗口中打开)中,智能体使用代码和终端工具完成科学研究工作流,包括数据分析、运行模拟和模型拟合。

事实准确性

GPT‑6.1 Sol 也在困难提示下提高了事实准确性。与 GPT‑6 Sol 相比,其最大的事实准确性提升出现在低推理努力场景下,其中包含事实错误的回答比例从 11.4% 降至 7.7%,降幅约为 32%。在测试的各种推理设置中,其错误率始终保持在低于 GPT‑6 Astra 1.9 个百分点的范围内,且每项任务的成本不足其五分之一。

该评估衡量的是在用户标记了早期模型错误的去标识化对话中,包含至少一个事实错误的回答所占的比例。这些刻意设计的困难提示并不能代表典型的使用场景。

我们在去标识化的 ChatGPT 对话中对事实准确性进行了评估,这些对话中的用户曾指出先前模型的事实错误。这些诱发错误的对话并不代表典型使用情况,因为在典型使用中事实错误更为罕见。

安全部署 GPT‑6.1 Sol

在我们的对齐评估中,GPT‑6.1 Sol 相比 GPT‑6 Sol 取得了显著改进,使其更接近 GPT‑6 Astra。

GPT‑6.1 Sol 对其局限性更加透明,在尊重用户意图和安全约束方面也更加可靠。在具有挑战性的评估中,它在关于损坏搜索工具的透明度、尊重明确限制以及在智能体任务中避免未经授权的结果方面,失败率低于 GPT‑6 Sol。我们未观察到任何试图绕过自动安全审查者的尝试,这与 GPT‑6 Astra 和 GPT‑6 Sol 的表现一致。详细信息请参阅 GPT‑6.1 Sol 系统卡附录(在新窗口中打开)。

以下评估刻意测试了具有挑战性的情境,并未衡量典型使用情况下的失败率。

损坏的搜索工具
审查者绕过
警告规避
计算机使用安全

该评估测试智能体是否在搜索工具损坏时告知用户,而不是给出其最佳猜测。GPT‑6.1 Sol 在 2.1% 的情况下未能披露问题,而 GPT‑6 Sol 为 4.9%,GPT‑6 Astra 为 1.5%,GPT‑6 Luna 为 28.7%。所选任务旨在诱发失败,并不代表典型使用情况。推理努力设置为最大值。

定价与可用性

GPT‑6.1 Sol 今日起向 ChatGPT Work 和 Codex 中的所有 Plus、Pro、Business、Enterprise 和 Edu 用户开放。GPT‑6.1 Sol 目前尚未在 Chat 中提供。开发者也可通过 OpenAI API 以 gpt-6.1-sol 的形式访问它。其标准 API 价格为每百万输入令牌 2 美元,每百万缓存输入令牌 0.10 美元,每百万输出令牌 10 美元。在未来几天内,我们还将提供 GPT‑6.1 Sol Ultrafast⁠(在新窗口中打开),其在 Codex 中的令牌生成速度最高可达标准速度的 8 倍。

2026
GPT
作者
OpenAI

对 GPT 的评估是在我们的研究环境中或通过我们的 API 进行的,由于系统提示、可用工具、推理努力等方面的差异,其输出可能与生产环境的 ChatGPT 略有不同。竞争对手模型的评估数据来自公开可用的报告。

继续阅读
查看全部
推出 GPT-6 Sol 和 Luna

产品
2026年9月22日

GPT-6 Astra:新一代智能

研究
2026年9月3日

DevDay 2026 回顾

公司
2026年9月29日

本条评分 12.4 score-v1
  • 来源权威 10
    注册表 priority=10(OpenAI)
  • 时效 2.358
    发布 12.5 小时前,衰减到 2.36/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)
历史
刊期得分排名结果
2026-09-30 9.7 7 入选
2026-09-30 12.36 7 入选
原文链接:https://openai.com/index/introducing-gpt-6-1-sol
来源:OpenAI
以上内容由 AI 自动翻译,仅供参考。
← 返回简报