# 谷歌为 Gemini Flash 系列模型推出智能体视频理解功能，成本最高降 66%、Token 消耗最高降 88%

- 来源：IT之家（RSS）
- 发布时间：2026-09-02 01:16
- AIHOT 分数：63
- AIHOT 链接：https://aihot.news/items/cmtjyffeg07ecroiy44nwm3li
- 原文链接：https://www.ithome.com/0/997/190.htm

## AI 摘要

谷歌在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中推出智能体视频理解（agentic video understanding）功能，替代按固定帧率读取视频的静态处理方式，让模型在视觉帧、音频和转录文本中动态搜索和检查目标片段。

## 正文

IT之家 9 月 2 日消息，谷歌今日宣布在最新的 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 模型中，推出 智能体视频理解（agentic video understanding）功能。该新功能可提升视频分析准确率，同时大幅减少视频分析过程中的 Token 使用量和成本。

该功能使用标准 Gemini API Token 定价，不收取额外功能费用。

与现有“静态”处理方式（模型按固定帧率读取视频，默认 1 FPS，可通过 API 调整）不同，智能体视频理解将模型核心推理与原生视频工具结合，可在视觉帧、音频和转录文本中动态搜索、扫描和检查目标视频片段。

在标准视频分析基准测试中，搭载智能体视频理解的 Gemini 模型可将分析成本降低最高 66%，Token 消耗量降低最高 88%，同时将准确率提升最高 7%。这类效率提升在长视频场景中尤为明显，因为传统静态处理会让开发者不得不在高 Token 成本和丢失关键细节之间做取舍。

谷歌指出，Gemini 3.7 Flash 搭配智能体视频理解可实现最佳的整体质量，同时在质量和成本效率间达到最优平衡，在视频理解任务中，位于准确率与成本的帕累托最优前沿。

不同于静态处理中模型按固定帧率读取媒体流，智能体视频理解让 Gemini 可以主动、有目标地决定观看哪些内容、以何种速度观看、通过哪种模态（帧、音频或转录文本）获取信息，仅提取所需的片段和信号。此前开发者只能手动完成这类操作，而借助智能体视频理解，Gemini 可通过智能循环完成，调用内部工具加载视频相关部分，大幅减少开发工作量。

据IT之家了解，该功能为开发者处理长视频内容带来了诸多新能力。

亚秒级时刻检索：精准定位在 1 FPS 下容易错过的瞬间状态变化和紧凑剪辑边界，实现高精度自动化视频编辑。

长视频“大海捞针”搜索：在数小时长的视频中回答复杂查询，且无需消耗数百万 Token。

异常检测：对感兴趣的时间窗口以更高帧率重新采样，检查快速运动和细微视觉伪影。

动作与物体计数：随时间推移精准跟踪重复物理动作和不同物体。

目前该功能已在 Google AI Studio 和 Gemini Enterprise Agent Platform 的 Gemini API 中上线，支持视频上传和 YouTube 视频分析。开发者只需在 API 配置中将处理模式设置为“agentic”即可启用该功能。

谷歌还计划将这项能力推广到旗下更多面向普通用户的产品，该功能很快就会向 Gemini 应用中所有 Flash 和 Flash-Lite 模型用户推送；未来几个月内，智能体视频理解还为 YouTube 视频观看页的“Ask YouTube”功能提供支持，借助 Gemini 提供基于视频画面的更高质量回答。
