跳到正文
原文
The Decoder:AI News(RSS)· Matthias Bastian·· 3 小时前同事件AI 评分76

Google 发布 Gemini 4 Argon:缩小与 OpenAI 和 Anthropic 的差距但未明显领先

Google Gemini 4 Argon closes the gap with OpenAI and Anthropic but doesn't take a clear lead

AI 导读

Google 发布新旗舰模型 Gemini 4 Argon,是继 Gemini 3.1 Pro 之后七个多月来的首款前沿模型。

同一事件,精选展示《Google DeepMind 发布 Gemini 4 Argon,面向可信网络防御者先行开放》

正文 · AI 翻译

Google 发布了 Gemini 4 Argon,这是其新的前沿模型,缩小了与 OpenAI 和 Anthropic 竞争对手的差距,并在一些关键基准测试中击败了其中一些对手。虽然它可能并未明显领先,但作为前沿模型来说相对便宜,至少在 introductory 价格上是如此。

Argon 是 Google 七个多月来继 Gemini 3.1 Pro 之后的首个前沿模型。它让这家广告巨头重新跻身前三 AI 实验室之列,不过 Anthropic 可能仍保持领先。在经历了一段艰难而漫长的开发期、期间已宣布的 Gemini 3.5 前沿模型被完全跳过之后,Google 重新回到了竞赛中。

大多数用户将不得不等待

Argon 最初将提供给一组“受信任的网络防御者”,作为 Fairwind 计划的一部分。他们和 Google 内部团队将获得不带网络防护栏的该模型。Google 以这一级别 AI 能力所需的“分阶段方法”为由,为逐步推出辩护。该公司还参与了美国政府的自愿计划,该计划让各机构在公开发布前获得新模型。

早期测试者的反馈将纳入该模型的安全机制。只有在此之后,Google 才计划向开发者、企业和消费者开放 Argon,首先从付费 API 客户和 Google AI Ultra 订阅者开始。该公司尚未给出日期,只表示“尽快”。

定价已经确定,至少作为 introductory 费率:每百万输入 token 2 美元,每百万输出 token 10 美元。缓存输入 token 成本低 95%,约为每百万 10 美分。Gemini 3.8 Flash 有 90% 的缓存折扣。这使 Google 在原始 token 价格上远低于其他前沿模型,不过在 token 消耗量上并非如此(见下文)。

每百万 token 价格 Gemini 4 Argon(促销) Gemini 4 Argon(常规) GPT-6 Astra Claude Fable 5.1 Claude Opus 5.5
输入 Token 2 $ 4 $ 10 $ 10 $ $4
输出 token $10 $20 $50 $50 $20
缓存读取操作 $0.10* $0.20* $1 $0.25 $0.20
缓存写入操作 不适用 不适用 $12.50 $12.50(5 分钟)/ $20(1 小时) $5(5 分钟)/ $8(1 小时)

*Google 没有明确说明这一数字,但表示缓存比常规输入 token 价格便宜 95%。

Google 还将输出上限从 64,000 提高到一百万个 token,称这是行业首创。其理念是,如果模型能在单次轨迹中生成数十万个 token,它就能更彻底地思考难题并一次性解决。为支持这一点,Google 正在为 Gemini API 添加一项新的“Long Decode Continuation”功能。它会暂停长响应,并通过后续请求恢复它们,以免推理超时。

输入上下文窗口保持在一百万个 token。Argon 接受文本、图像、视频和音频作为输入,但只输出文本。

独立测试显示 Argon 与 GPT-6 Astra 相当,但消耗更多 token

Artificial Analysis 提供了早期独立评估。在其可用的最高推理级别“High”下,Gemini 4 Argon 在 Artificial Analysis Intelligence Index 上得分 53 分。这与 OpenAI 的 GPT-6 Astra(max)和 Claude Fable 5.1 持平,并比 GPT-6.1 Sol(max)高出一分。

Anthropic 的模型仍然领先。Claude Opus 5.5 以 58 分位居榜首,Claude Sonnet 5.5 为 56 分。与 Google 上一款前沿模型 Gemini 3.1 Pro Preview 相比,Argon 跃升了 23 分。"High"通常是 Gemini 模型的最高推理层级,不过有时也支持特殊的"Deep Think"模式。

按当前促销价计算,一项 Intelligence Index 任务花费 1.99 美元。这是 GPT-6 Astra 成本(3.26 美元)的 60%,但比 GPT-6.1 Sol 贵 2.7 倍。折扣结束后,成本将升至 3.98 美元,比 GPT-6 Astra 高出约 20%。价格优势来自更低的 token 费率,而非效率。Argon 每项任务平均使用 62,000 个输出 token,而 GPT-6 Astra 仅需 27,000 个。

Artificial Analysis 结果显示,处于"High"模式的 Argon 正在追赶顶级梯队。| 图片:Artificial Analysis

Argon 在智能体任务上也取得了显著进步,据 Artificial Analysis 称,这曾是 Gemini 模型的弱项。在 AutomationBench-AA(Artificial Analysis 的变体)上,它以 77.5% 的成绩位居第一,领先 Claude Sonnet 5.5(max)6 个百分点。在 Terminal Bench 4 上,它达到 57%,比 Gemini 3.1 Pro Preview 跃升 53 个百分点。但这仍落后于 Claude Sonnet 5.5(64%)、Claude Opus 5.5(60%)和 GPT-6 Astra(59%)。

Artificial Analysis 还强调了 Argon 的低幻觉率。在 AA-Omniscience 这一测试事实知识和诚实处理知识空白的基准上,Argon 的幻觉率为 15%。GPT-6 Astra(max)为 51%,GPT-6.1 Sol(max)为 54%。Argon 更有可能承认自己不知道答案,而不是胡乱猜测。不过其准确率仅达到 50%,比 Gemini 3.1 Pro Preview 低 5 个百分点,比 GPT-6 Astra(max,63%)低 13 个百分点。在该基准的总分上,Argon 为 42 分,与 GPT-6 Astra(43)和 GPT-6.1 Sol(42)大致持平。

Google 自家的基准测试结果则描绘了一幅更乐观的图景。Argon 在其中大多数基准上领先,有时优势明显。

Google 对 Gemini 4 Argon 的内部基准测试结果。| 图片:Google

Argon 还在 Vals Index 上领先。据 Vals AI 称,它以 68.9% 位居第一,成为首个登顶该指数的 Gemini 模型。在 22 项受测基准中,Argon 有 20 项进入前五,在金融、法律、编程和安全方面尤为突出。不过在这项测试中,中端模型 Sonnet 5.5 也超过了 Anthropic 的顶级模型 Opus 5.5,所以仅供参考。

一如既往,AI 模型必须在实际使用中证明自己,而性能不仅取决于模型本身,还取决于围绕它的软件。这正是 Google 目前的弱项:与 Claude Cowork 和 ChatGPT Work 相比,Gemini 应用仍然落后。

Argon 在文本人类偏好排名中登顶

在 Arena.ai 上,人类通过两两对比来评价模型输出,Argon 表现出色。在 Text Arena 中,Gemini 4 Argon(High)以 1,525 分位居第一,领先第二名 Claude Opus 4.6(High)20 分。这使其成为写作任务的有力竞争者,尤其是在经历了竞争性写作模型的长期空窗期,且 Opus 5.5 在人类偏好排名中仍不及 Opus 4.6 之后。Google 此前的模型 Gemini 3.8 Flash(High)曾位列第十一。

根据 Arena 的数据,Argon 在编程、高难度提示词、指令遵循、较长查询和创意写作方面处于领先地位。它在所有受评估的专业领域均排名第一,在英语、中文、俄语查询以及整体非英语查询中也同样位居榜首。

Web 开发方面的表现则较为一般。在 Code Arena: WebDev 中,Argon 得分为 1,679 分,位列第八。这比 Gemini 3.8 Flash (High) 提升了 96 分,排名也从第 29 位跃升,但未能进入前列。

在性价比方面,Arena 认为 Argon 领先于同行。按每百万 token 8 美元的混合费率计算,Argon 推动了 Text Arena 的帕累托前沿,并且目前是排名中最具成本效益的模型。

来源:The Decoder:AI News(RSS) · the-decoder.com