跳到正文
热点事件持续更新

ARC Prize公布Grok 4.7在ARC-AGI三项基准成绩

6 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

ARC Prize 公布了 SpaceXAI 的 Grok 4.7 在 ARC-AGI 三项基准上的评测成绩。ARC-AGI-3 上,标准测试框架(允许模型在轮次之间保留笔记)得分 1.8%,成本 $2.7k;新的提供商适配器框架(保留不透明推理并启用自动压缩)得分 10.0%,成本 $4.8k。ARC-AGI-2 最佳得分 61.4%,每任务 $2.01;ARC-AGI-1 为 90.2%,每任务 $0.64。 与 Grok 4.6 相比,Grok 4.7 在 ARC-AGI-1 上更高,但在 ARC-AGI-2 和 3 上更低:ARC-AGI-2 由 67.1% 降至 61.4%,每任务成本由 $0.76 升至 $2.01,涨幅 166%,尽管输入输出 token 定价相同。ARC Prize 称,Grok 4.7 在 ARC-AGI-2 semi-private 任务的中、高、xhigh 推理档位平均消耗的 reasoning token 均多于 Grok 4.6,推高了每任务成本;其公开得分与 token 用量相关,low 档平均每次尝试约 10k token、得分 25%,medium 至 xhigh 档约 86k 至 120k token、得分 57.5% 至 60%。 同一来源的表述中,标准框架一项还出现“Grok 4.7 为 2.1%”的对照数字,与 1.8% 的得分并列出现。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. ARC Prize
    Grok 4.7 推理 token 用量与 ARC-AGI-2 得分相关

    @SpaceXAI Grok 4.7 的推理 token 用量与其 ARC-AGI-2 公开得分相关:low 档平均每次测试对尝试用 10k token,得分 25%;而 medium 到 xhigh 档用 86k 到 120k token,得分 57.5% 到 60%。low 档更低的 token 用量可能有助于解释其更低的得分。

  2. ARC Prize
    ARC Prize 公布 Grok 4.7 测试结果

    @SpaceXAI - 排行榜:https://arcprize.org/leaderboard - 复现公开结果:https://github.com/arcprize/arc-agi-benchmarking - 测试政策:https://arcprize.org/policy - Grok 4.7 完整结果:https://arcprize.org/results/xai-grok-4-7

  3. ARC Prize
    Grok 4.7 在 ARC-AGI-2 上推理 token 用量高于 4.6

    Grok 4.7 在 ARC-AGI-2 semi-private 任务的中、高、xhigh 推理档位上平均消耗的 reasoning token 均多于 Grok 4.6,导致每任务成本更高。

  4. ARC Prize
    Grok 4.7 在 ARC-AGI-2 跑分成本大涨

    @SpaceXAI 在 ARC-AGI-2 上,Grok 4.7 的最佳得分为 61.4%,每任务成本 $2.01,而 Grok 4.6 为 67.1%,每任务成本 $0.76——尽管输入和输出 token 定价完全相同,每任务成本仍上涨了 166%。 完整结果:https://arcprize.org/results/xai-grok-4-7

  5. ARC Prize
    Grok 4.7 在 ARC-AGI-3 的评测成绩

    @SpaceXAI 在 ARC-AGI-3 上,Grok 4.7 在标准测试框架中得分 1.8%(Grok 4.7 为 2.1%),该框架允许模型在轮次之间保留笔记;在新的提供商适配器框架中得分 10.0%,该框架保留不透明推理并启用自动压缩。

  6. ARC Prize
    ARC Prize 公布 Grok 4.7 在 ARC-AGI (Verified) 上的评测成绩

    ARC Prize 公布 Grok 4.7 在 ARC-AGI (Verified) 上的成绩:ARC-AGI-3 为 1.8%($2.7k,标准 harness),用 provider adapter harness 为 10.0%($4.8k);ARC-AGI-2 为 61.4%($2.01/task);ARC-AGI-1 为 90.2%($0.64/task)。与 Grok 4.6 相比,Grok 4.7 在 ARC-AGI-1 上更高,但在 ARC-AGI-2 和 3 上更低。

本事件热度走势

可比范围当前
9
可比范围峰值
1010月7日 01:00
近 24 小时变化
–

趋势仅比较持续完整观测到的相同主体,范围可能小于当前热度统计。移动指针或点击图表查看每小时热度;键盘可用左右方向键切换。