2026 年 9 月 1 日,Google DeepMind 在 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite 三款模型上上线「智能体视频理解」(agentic video understanding)能力。官方基准数据显示,这项能力可将视频分析的 token 消耗最高降低 88%、成本最高降低 66%,同时准确率最高提升 7%。
从固定抽帧到主动查找
此前的视频理解走的是静态处理路线:模型按固定帧率(默认每秒 1 帧,可通过 API 调整)把整段视频流吞进去。处理长视频时,要么 token 成本居高不下,要么靠抽帧技巧省 token 却丢掉关键细节。
智能体式处理改变了这个逻辑。模型不再被动消化整段视频,而是以完成任务为目标,自主决定看什么内容、以多快的速度看、通过哪个模态看——画面、音频还是转写文本。它调用 Gemini 的原生视频工具,按需加载视频文件的对应片段,只提取任务所需的时刻与信号。
官方基准:88%、66%、7%
在标准视频分析基准测试中,开启智能体视频理解后,Gemini 模型的分析成本最高降低 66%,token 消耗最高降低 88%,准确率最高提升 7%。
三款模型都能获得这些增益,其中 Gemini 3.7 Flash 综合表现最佳,处于准确率与成本的帕累托前沿,是目前视频理解任务中质量与成本兼顾的最优选择。
四种典型能力
智能体视频理解带来四类此前的固定抽帧难以做到的处理:
- 亚秒级时刻检索:捕捉转瞬即逝的状态变化与剪辑边界——1 FPS 抽帧容易漏掉这些瞬间,该能力可直接用于自动化视频剪辑;
- 长视频大海捞针式检索:在不消耗数百万 token 的前提下,回答跨多小时视频的复杂问题;
- 异常检测:对感兴趣的时间窗口按更高 FPS 重新采样,观察快速运动与细微画面异常;
- 动作与物体计数:跨时间准确追踪重复的物理动作与特定物体。
长视频收益最明显
效率提升在长视频上尤为突出——从 10 分钟的教程、90 分钟的讲座到多小时录播。静态处理迫使开发者在高 token 成本与抽帧丢细节之间二选一,智能体处理按需取帧,把两个问题一起解决。
开发者如何接入
该能力已通过 Gemini API 开放,支持视频上传与 YouTube 视频分析,入口包括 Google AI Studio 与 Gemini Enterprise Agent Platform。按标准 token 定价计费,无额外功能费。启用方式是在 API 配置中将 processing 设为「agentic」。
后续计划
Google 称,这项能力将向 Gemini app 全部用户(Flash 与 Flash-Lite 模型)铺开,未来数月还会驱动 YouTube 观看页的「Ask YouTube」功能,基于视频画面给出答案。
对视频分析开发者而言,成本结构已经改变:同样的任务,token 开销可降到原来的约八分之一,而准确性不降反升。接入的第一步,只是改一个 API 参数。