← 返回 2026-09-22 简报

xAI以低价推出Grok 4.7,但基准测试显示其与Claude和GPT-6之间存在显著差距

xAI launches Grok 4.7 at bargain prices, but benchmarks reveal a wide gap to Claude and GPT-6

语音播报
摘要
事件:xAI推出低价模型Grok 4.7,主打编程与知识工作,定价远低于西方前沿模型,接近中国竞品水平。 要点:Artificial Analysis基准测试中得分46,落后Claude和GPT-6的53分;代理编程测试仅26%,不及DeepSeek V4.1 Flash。 影响:显示低价策略下性能差距显著,开发者需权衡成本与能力,xAI在高端市场仍面临巨大挑战。

xAI 以优惠价格推出 Grok 4.7,但基准测试显示其与 Claude 和 GPT-6 之间存在巨大差距

埃隆·马斯克(Elon Musk)旗下的 xAI 推出了 Grok 4.7,这是其迄今为止在编码和知识工作方面能力最强的模型。据该公司称,该模型基于更大的基础模型构建,经过更长时间的强化学习训练,并被设计用于更好地验证其自身的输出。其定价为每百万输入令牌 2 美元,每百万输出令牌 6 美元。这些费率更接近中国模型,而非西方前沿模型,这背后可能有其原因。在结合十项基准测试的独立 Artificial Analysis Intelligence Index(v4.3.2)中,Grok 4.7 得分 46,位列中游。Claude Fable 5.1 和 GPT-6 以各 53 分领先。

Grok 4.7(黑色)总体得分为 46,明显落后于各得 53 分的 Claude Fable 5.1 和 GPT-6。其两个最高推理水平的表现似乎大致相同。| 图片来源:Artificial Analysis

在智能体编码方面,差距进一步扩大。在 Terminal-Bench 4.0 中,Grok 4.7 仅达到 26%,而 GPT-6 Astra 为 60%,Claude Fable 5.1 为 55%。甚至更便宜的 DeepSeek V4.1 Flash 也以 27% 的成绩超越它。该模型可通过 Grok API、Cursor 和 Grok Build 获取。

Grok 4.7 在 Terminal-Bench 4.0 的智能体编码测试中得分为 26%,远远落后于 GPT-6 Astra(60%)和 Claude Fable 5.1(55%)。| 图片来源:Artificial Analysis

没有炒作成分的 AI 新闻 – 由人工策划

订阅 THE DECODER,享受无广告阅读、每周 AI 通讯、每年六次的独家“AI Radar”前沿报告、完整档案访问权限以及评论版块访问权。

立即订阅

本条评分 10.7 score-v1
  • 来源权威 8
    注册表 priority=8(The Decoder)
  • 时效 2.695
    发布 5.6 小时前,衰减到 2.70/3.0
  • 多源印证 0
    只有 1 家在报(无旁证)
  • 社区信号 0
    无社区数据(本管线走 RSS,HN 的 hn_fetcher 未接入)

首次收录 · 2026-09-22 · 10.7 分

原文链接:https://the-decoder.com/xai-launches-grok-4-7-at-bargain-prices-but-benchmarks-reveal-a-wide-gap-to-claude-and-gpt-6/
来源:The Decoder
以上内容由 AI 自动翻译,仅供参考。
← 返回简报