Artificial Analysis 评测 Google DeepMind 新模型 Gemini 4 Argon,在 Artificial Analysis Intelligence Index 得 53 分,追平 GPT-6 Astra (max),高于 GPT-6.1 Sol (max) 1 分。
评测方给出 Intelligence Index、成本和幻觉率等实测数据,读者可以对比 Gemini 4 Argon 与 GPT-6 Astra 的性价比差异。
Google 的新 Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上以每次任务成本 60% 的折扣价格与 GPT-6 Astra 持平。Google 现在重新成为智能水平最高的三大实验室之一
Gemini 4 Argon 是 @GoogleDeepMind 在超过 7 个月里首个高于 Flash 级别的专有模型。在高推理(可用的最高档)下,它在 Artificial Analysis Intelligence Index 上得分 53,与 GPT-6 Astra(max,53)持平,并领先 GPT-6.1 Sol(max,52)1 分,提升由更低的幻觉和更强的智能体能力驱动。
在其当前 50% 价格折扣且缓存折扣提高到 95% 的情况下,Gemini 4 Argon 每项 Intelligence Index 任务成本为 $1.99,是 GPT-6 Astra(max)的 60%,但是 GPT-6.1 Sol(max)的 2.7 倍。折扣结束后,这将升至 $3.98(约为 GPT-6 Astra(max)的 1.2 倍)。
Gemini 4 Argon 目前正在向部分用户推出,尚未公开可用。50% 折扣是初期促销。Google 尚未确认促销结束日期
Gemini 4 Argon 在高推理下的关键基准测试结果:
➤ Google 作为智能水平最高的三大实验室之一回归:Gemini 4 Argon(high)在 Artificial Analysis Intelligence Index 上得分 53,与 GPT-6 Astra(max,53)持平,并领先 GPT-6.1 Sol(max,52)1 分。这比 Google 上一个非 Flash 模型 Gemini 3.1 Pro Preview(30)高 23 分,并领先 Gemini 3.8 Flash(high)12 分
➤ 50% 的发布折扣使 Gemini 4 Argon 在每次任务成本上具有竞争力:在当前折扣价格下,Gemini 4 Argon(high)每项 Intelligence Index 任务成本为 $1.99,在可比智能水平下是 GPT-6 Astra(max,$3.26)的 60%。这种成本效率由更低的 token 价格驱动,而不是更少的 token 使用量,Gemini 4 Argon 平均每项任务输出 62k tokens,而 GPT-6 Astra(max)为 27k。Google 尚未确认促销结束日期,但按标准价格,每次任务成本将增至 $3.98
➤ 更强的智能体表现:这历来是 Gemini 模型的较弱领域,Gemini 4 Argon 在各项智能体评估中显示出改进。它在 AutomationBench-AA 上以 77.5% 排名第 1,领先 Claude Sonnet 5.5(max,71.3%)6 分。在 Terminal Bench 4 上,Gemini 4 Argon 达到 57%,比 Gemini 3.1 Pro Preview 提升 +53 分,仅落后于 Claude Sonnet 5.5(max,64%)、Claude Opus 5.5(max,60%)和 GPT-6 Astra(59%)。在 AA-Briefcase 上,它达到 1494 Elo。这由 65% 的评分标准通过率驱动,这是我们记录到的最高值,但 Analytical Quality(1576 Elo)和 Presentation Quality(1308 Elo)较低
➤ 领先模型中最低的幻觉率:在 AA-Omniscience 上,Gemini 4 Argon 的幻觉率为 15%,是所有在 Intelligence Index 上得分 45+ 的模型中最低的,相比之下 GPT-6 Astra(max)为 51%,GPT-6.1 Sol(max)为 54%。这意味着 Argon 更可能承认自己不知道答案,而不是错误猜测。在准确率上,Gemini 4 Argon 得分 50%,比 Gemini 3.1 Pro Preview 下降 5 分,并比 GPT-6 Astra(max,63%)低 13 分。由于这一略低的准确率,其 AA-Omniscience 总分 42 仍与 GPT-6 Astra(43)和 GPT-6.1 Sol(42)一致
关键模型细节:
➤ 上下文窗口:1M tokens
➤ 多模态:文本、图像、视频和语音输入,文本输出
➤ 定价:标准价格为每 1M 输入/输出 tokens $4/$20,当前折扣 50% 至 $2/$10。缓存输入 tokens 享受 95% 折扣(折扣价格下每 1M $0.10),高于 Gemini 3.8 Flash 的 90%
➤ Long Decode Continuation:我们用 Long Decode Continuation 测试了 Gemini 4 Argon,这是一项新的 Gemini API 功能,可暂停长响应并在后续调用中恢复它们。这使推理可运行最多 1M 输出 tokens 而不会请求超时
来源:Artificial Analysis · x.com