Gemini 智能体视频处理并非总更便宜:24 次运行基准
来源:dev.to — 2026-09-04
📋 概述
Google 于 9 月 1 日推出 Agentic Video Understanding,宣称长视频最多省 88% token、降 66% 成本。作者用 Gemini 3.7 Flash 在自有的长短两支视频上跑了 4 种负载 × 2 种模式 × 3 次重复 = 24 次受控 API 调用,结果戳破了「智能体一定更省」的说法:长视频摘要省 97.6% token、一次性细节检索省 92.2%;但短视频上智能体反而多用 20% 和 222% 的 token,并且方差极大。结论是智能体处理是一道按负载路由的决策题,而非静态处理的通用替代品。
🔑 核心要点
- 长视频是智能体处理的甜区:10 分钟演讲做摘要只用静态 2.4% 的 token,单次细节检索约 7.8%,还能避开把整段视频上下文加载进来
- 短视频方向相反:普通 UI 变化多用 20% token,短暂视觉事件多用 222% 且耗时三倍以上——导航的代价可能高过直接采样整段片段
- 方差极大:同一短暂运动查询的三次 agentic 运行 token 从 12,300 到 56,487 不等,取到哪个样本会讲出完全不同的故事,一次运行不足以定论
- 多花的成本确实买到了更好的细节:agentic 抓到只出现约 0.2 秒的『正在加载』屏幕,静态处理只抓到持续约两秒的明显事件——但产品只需要一个明显转场时,静态答案已够快够稳
- 必须校验 processing 是否真的跑过:12 次 agentic 调用都含 processing_call 与 processing_result,12 次静态调用都不含;否则无法解释质量也无法解释成本
- 落地建议:用视频长度 × 查询类型做路由(长摘要/长片找句子用 agentic,短片段重延迟用 static,亚秒运动与极小文字两种都测),并记录实际处理步骤与 token 分类
💡 金句
智能体视频理解给你的是一个新的有用控制旋钮,而不是一张停止测量的许可证。
👍 0
👎 0
← 返回 dev.to 首页