跳到正文
原文
Artificial Analysis 完整文章(网页)·· 1 天前精选AI 评分78

Artificial Analysis 评测 Gemini 4 Argon:Google 重回智能前三梯队

Gemini 4 Argon: Google is back as one of the top three labs in intelligence achieved

AI 导读

Artificial Analysis 评测 Google DeepMind 的 Gemini 4 Argon,其高推理档在 Artificial Analysis Intelligence Index 得分 53,追平 GPT-6 Astra (max)、领先 GPT-6.1 Sol (max) 1 分。

推荐理由

评测方给出与竞品的价格和智能指数对比,读者可据此评估 Google 新模型在成本与智能上的真实位置。

正文 · AI 翻译

查看模型页面

Google 的新 Gemini 4 Argon 在 Artificial Analysis 智能指数上追平 GPT-6 Astra,在折扣价格下每任务成本仅为其 60%

Gemini 4 Argon 是 Google DeepMind 七个多月来首个高于 Flash 级别的专有模型。在高推理模式(可用的最高档)下,它在 Artificial Analysis 智能指数上得分 53,与 GPT-6 Astra(max,53)持平,领先 GPT-6.1 Sol(max,52)1 分,其提升主要来自更低的幻觉率和更强的智能体能力。

在当前 50% 的价格折扣以及缓存折扣提高至 95% 的情况下,Gemini 4 Argon 每完成一个智能指数任务的成本为 1.99 美元,是 GPT-6 Astra(max)的 60%,但却是 GPT-6.1 Sol(max)的 2.7 倍。折扣结束后,这一成本将升至 3.98 美元(约为 GPT-6 Astra(max)的 1.2 倍)。

Gemini 4 Argon 目前正在向部分选定用户逐步推出,尚未公开可用。50% 折扣是初期促销。Google 尚未确认促销结束日期

Gemini 4 Argon 在高推理模式下的关键基准测试结果:

➤ Google 重返智能领域前三实验室之列: Gemini 4 Argon(high)在 Artificial Analysis 智能指数上得分 53,与 GPT-6 Astra(max,53)持平,领先 GPT-6.1 Sol(max,52)1 分。这比 Google 上一款非 Flash 模型 Gemini 3.1 Pro Preview(30)高出 23 分,并领先 Gemini 3.8 Flash(high)12 分

➤ 50% 的发布折扣使 Gemini 4 Argon 在每任务成本上具有竞争力: 在当前折扣价格下,Gemini 4 Argon(high)每完成一个智能指数任务的成本为 1.99 美元,在智能水平相当的情况下,是 GPT-6 Astra(max,3.26 美元)的 60%。这种成本效率源于更低的 token 价格,而非更少的 token 使用量,Gemini 4 Argon 平均每任务输出 62k token,而 GPT-6 Astra(max)为 27k。Google 尚未确认促销结束日期,但按标准价格计算,每任务成本将升至 3.98 美元

➤ 更强的智能体表现: 这历来是 Gemini 模型的弱项,而 Gemini 4 Argon 在各项智能体评估中均有所提升。它在 AutomationBench-AA 上以 78% 排名第一,领先 Claude Sonnet 5.5(max,71%)7 分。在 Terminal Bench 4 上,Gemini 4 Argon 达到 57%,较 Gemini 3.1 Pro Preview 提升 53 分,仅次于 Claude Sonnet 5.5(max,64%)、Claude Opus 5.5(max,60%)和 GPT-6 Astra(59%)。在 AA-Briefcase 上,它达到 1494 Elo。这得益于 65% 的评分标准通过率,这是我们记录到的最高值,但分析质量(1576 Elo)和呈现质量(1308 Elo)较低

➤ 领先模型中最低的幻觉率: 在 AA-Omniscience 上,Gemini 4 Argon 的幻觉率为 15%,是所有在智能指数上得分 45+ 的模型中最低的,相比之下 GPT-6 Astra(max)为 51%,GPT-6.1 Sol(max)为 54%。这意味着 Argon 在不知道答案时更可能承认,而不是错误猜测。在准确率方面,Gemini 4 Argon 得分为 50%,较 Gemini 3.1 Pro Preview 下降 5 分,比 GPT-6 Astra(max,63%)低 13 分。由于准确率略低,其 AA-Omniscience 总分 42 与 GPT-6 Astra(43)和 GPT-6.1 Sol(42)基本持平

关键模型细节:

➤ 上下文窗口: 1M token

➤ 多模态: 文本、图像、视频和语音输入,文本输出

➤ 定价:标准定价为每 100 万输入/输出 token 4 美元/20 美元,目前享受 50% 折扣,降至 2 美元/10 美元,至少持续一个月。缓存输入 token 享受 95% 折扣(折扣价下每 100 万 token 0.10 美元),高于 Gemini 3.8 Flash 的 90%

➤ 长解码续接:我们使用 Long Decode Continuation 测试了 Gemini 4 Argon,这是 Gemini API 的一项新功能,可暂停长响应并在后续调用中继续。这使得推理可运行多达 100 万输出 token,而不会出现请求超时

如需进一步分析,请参阅 https://artificialanalysis.ai/models/gemini-4-argon

来源:Artificial Analysis 完整文章(网页) · artificialanalysis.ai