Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 三款新模型

Google DeepMind:Blog(RSS)·2026-07-21 23:16·53天前·Tulsee Doshi
AI 导读

Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 Gemini 3.6 Flash 为最新主力模型,3.5 Flash-Lite 主打更低成本与更高效率,3.5 Flash Cyber 则针对网络安全场景优化。三款模型均通过 Google AI 开发者平台提供 API 访问。

Google DeepMind:Blog(RSS)
精选
57AI 编辑部评分,满分 100

Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 与 3.5 Flash Cyber 三款新模型

2026-07-21 23:16· 53天前· Tulsee Doshi
AI 导读

Google DeepMind 推出 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber 三款新模型。其中 Gemini 3.6 Flash 为最新主力模型,3.5 Flash-Lite 主打更低成本与更高效率,3.5 Flash Cyber 则针对网络安全场景优化。三款模型均通过 Google AI 开发者平台提供 API 访问。

推荐理由

Gemini Flash 系列常规更新,Flash-Lite 和 Cyber 变体值得 API 开发者留意,但细节还没出来,目前只能先标记。

正文 · AI 翻译

我们最新的 Gemini 模型提供在大规模构建 AI 智能体时所需的效率、延迟和可靠性。


Tulsee Doshi

产品管理高级总监,代表 Gemini 团队


a hero image saying 3.6 Flash, 3.5 Flash-Lite, and 3.5 Flash Cyber

构建生产级 AI 智能体的开发者和客户需要更高的 token 效率、更低的延迟以及更可靠的性能。我们的 Flash 系列模型正是为满足效率与质量的最佳平衡点而打造,从而支持智能体工作流的规模化扩展。在 Gemini 3.5 Flash 的基础上,我们推出全新的 Gemini 模型:

  • 3.6 Flash:我们的主力模型,在编程、知识工作和多模态性能方面表现更佳。根据 Artificial Analysis Index,相比 3.5 Flash,它将输出 token 用量减少了 17%,而在 Datacurve 的 DeepSWE 等部分基准测试中,我们观察到降幅最高可达 65%,且每输出 token 的成本更低。
  • 3.5 Flash-Lite:我们最快、最具成本效益的 3.5 级模型,根据 Artificial Analysis Index,每秒可输出 350 个 token,在智能体工作流中也显著优于前几代 Flash-Lite。
  • CodeMender 中的 3.5 Flash Cyber:成功的网络安全应用需要将模型与智能体基础设施精心编排。我们推出了一款全新的、高效的、专注于网络安全的专用模型,并将其与我们的 CodeMender 代码安全智能体相结合,在前沿水平上提供极具竞争力的性能。

在今日发布之外,Gemini 3.5 Pro 目前正在与合作伙伴进行测试,我们计划在准备就绪后尽快将其广泛开放。与此同时,我们的团队已经在专注于构建下一代模型。我们已经启动了迄今为止最具雄心的预训练运行,用于 Gemini 4,并对其进展感到兴奋。

3.6 Flash:比 3.5 Flash 更高效、质量更好

Gemini 3.6 Flash 直接建立在来自 3.5 Flash 的开发者和客户反馈之上。3.6 Flash 不仅在编码和知识工作方面实现了提升,同时还在显著改善 token 效率。例如,在 Artificial Analysis Index 上,我们看到 3.6 Flash 的输出 token 消耗比 3.5 Flash 少 17%。它完成多步骤工作流所需的推理步骤和工具调用也更少。

这种增强的效率还结合了比 3.5 Flash 更低的价格。在 $1.50/1M 输入 token 和 $7.50/1M 输出 token 的价格下,3.6 Flash 降低了每个智能体任务的总体成本,使智能体的构建和运行更具成本效益。

视频 · 前往原文观看

在一个 OSWorld 验证任务(API)中,3.6 Flash 相比 3.5 Flash 展现出更好的 token 效率并减少了冗长程度

即便效率更高,3.6 Flash 在各类用例中的表现相比 3.5 Flash 仍有提升:

  • 3.6 Flash 精度更高,不必要的代码编辑更少,执行循环也更少,这一点在 DeepSWE 上有所体现(49% 对 37%);在 ML Research 上也有显著提升,这一点在 MLE Bench 上有所体现(63.9% 对 49.7%)。
  • 其计算机使用能力有所提升,这一点在 OSWorld-Verified 上有所体现(83.0% 对 78.4%)。计算机使用现已成为通过 Gemini API 和 Gemini Enterprise 提供的内置客户端工具。
  • 它在知识工作方面优于 3.5 Flash,GDPval-AA v2 等基准测试显示了这一点(1421 对 1349)。Hebbia 和 Harvey 等客户发现,它在文档解析、图表与数据分析以及报告起草等多模态任务上尤为出色。
视频 · 前往原文观看

3.6 Flash 在 AIS 上使用 Managed Agents,能够比 3.5 Flash 更高效、更准确地解析和分析财务数据与文字记录(AIS)

视频 · 前往原文观看

3.6 Flash 在 AGY 上利用多智能体编排执行代码迁移,相比 3.5 Flash 具有更低的延迟和更高的质量(AGY)

视频 · 前往原文观看

3.6 Flash 借助 canvas 帮助开发用于 3D 工作流的照片级纹理提取器(Gemini App)

视频 · 前往原文观看

3.6 Flash 利用 AGY 和 tldraw 离线编辑器,凭借其强大的视觉理解能力构建交互式主题工作室(AGY)。

chart chart

客户反馈,3.6 Flash 在成本和质量上均实现了进步,在复杂工作流和知识型任务中平衡了 token 效率、准确性和速度:

Quote from Figma Quote from Harvey Quote from Hebbia Quote from JetBrains

安全构建

3.6 Flash 在化学、生物、放射性及核(CBRN)以及网络攻击滥用领域,随附了增强的 Frontier Safety 防护措施。这些防护措施使模型对越狱的抵抗力大幅提升。与此同时,该模型经过训练,能够最大限度地减少对有益用途的拒绝。

如需了解更多信息,请参阅 3.6 Flash 模型卡。

3.5 Flash-Lite:为规模化智能体工作流而构建

除 Flash 之外,我们还发布了 Gemini 3.5 Flash-Lite,专为低延迟任务以及高吞吐量对开发者工作流至关重要的任务而设计,例如智能体搜索和文档处理。

3.5 Flash-Lite 是 3.5 系列中速度最快的模型。根据 Artificial Analysis 的测量,其运行速度为 350 输出 tokens/s。定价为 $0.3/1M 输入 tokens 和 $2.5/1M 输出 tokens,且质量显著优于 3.1 Flash-Lite,3.5 Flash-Lite 为运行高吞吐量生产流量的开发者和客户提供了强劲的性价比。

视频 · 前往原文观看

3.5 Flash-Lite 以比 3.5 Flash 更低的延迟执行高容量任务。

3.5 Flash-Lite 为智能体系统带来了高效的扩展能力。在各个思考层级上,该模型都显著优于 3.1 Flash-Lite。根据工作负载的不同,开发者可以将模型配置为以低延迟、低成本执行为优先,利用最低和低思考层级处理高并发任务,或者启用更高的思考层级来处理多步骤的子智能体工作负载。该模型现在还内置了计算机使用工具,以可靠地支持跨平台的这些智能体任务。

在编码和智能体任务上实现了显著提升,Terminal-Bench 2.1 上的表现为(54% 对 31%),长上下文方面体现在 GDM-MRCR v2(72.2% 对 60.1%),真实世界任务执行方面体现在 GDPval-AA v2(1140 对 642)。

chart

事实上,在许多智能体和编码评测中,3.5 Flash-Lite 甚至超越了 3 Flash,包括 SWE-Bench Pro(54.2% 对 49.6%)和 OSWorld-Verified(74.0% 对 65.1%),使其成为 2.5 和 3 Flash 上工作负载更快且能力更强的选择。

chart
视频 · 前往原文观看

3.5 Flash-Lite 从海量电商数据集中提取产品特征并进行综合整理。

视频 · 前往原文观看

3.5 Flash-Lite 与 3.6 Flash 作为主智能体协同工作,即时生成 25 个独特的、可直接探索的网页设计概念。

视频 · 前往原文观看

3.5 Flash-Lite 凭借其多模态理解能力,可以大规模地完成收据翻译和摘要。

视频 · 前往原文观看

3.5 Flash-Lite 通过即时生成并迭代多个方案来构建一款游戏。

3.5 Flash-Lite 的早期客户正在强调它在速度、智能和成本效率方面的独特组合,可用于扩展智能体工作流和数据处理任务:

Quote from Ashler Quote from Palo Alto Networks Quote from Ramp

如需了解有关该模型的更多信息,请参阅 3.5 Flash-Lite 模型卡。

CodeMender 中的 3.5 Flash Cyber:高效发现并修复漏洞

AI 模型发现安全漏洞的速度已经超过了现有系统修复漏洞的速度。应对这一日益增长的威胁,需要一种能力强大且高效的软件安全防护方法。

Flash 的性能和效率使其成为大规模检测、验证和修补代码安全问题的理想基础。Gemini 3.5 Flash Cyber 构建于 3.5 Flash 之上,并经过微调,用于发现和修复网络安全漏洞,其每 token 价格低于更大的模型。

在 CodeMender 中,多个 3.5 Flash Cyber 智能体协同工作以生成一份合并报告,3.5 Flash Cyber 在热门基准 CyberGym 上达到了前沿水平的竞争力表现。

chart

鉴于这项技术的两用性质,我们对 3.5 Flash Cyber 的部署采取了审慎的做法。该模型将很快通过 CodeMender 以限量访问试点计划的形式,独家提供给各国政府和可信合作伙伴。这将使一线防御者能够抢先发现并修复关键漏洞,赶在其被利用之前,同时降低被更广泛滥用的风险。

3.6 Flash 与 3.5 Flash-Lite:即刻开始使用

3.6 Flash 与 3.5 Flash-Lite 从今天起即可使用:

当你开始使用 3.6 Flash 和 3.5 Flash-Lite 进行构建时,我们欢迎你的反馈,以改进未来的 Gemini 模型,并期待很快发布 3.5 Pro。

来源:Google DeepMind:Blog(RSS)· deepmind.google