dev.to | 📄 原文链接 | 2026-09-05 收录

Gemini 智能体视频处理并非总更便宜:24 次运行基准

来源:dev.to — 2026-09-04

📋 概述

Google 于 9 月 1 日推出 Agentic Video Understanding,宣称长视频最多省 88% token、降 66% 成本。作者用 Gemini 3.7 Flash 在自有的长短两支视频上跑了 4 种负载 × 2 种模式 × 3 次重复 = 24 次受控 API 调用,结果戳破了「智能体一定更省」的说法:长视频摘要省 97.6% token、一次性细节检索省 92.2%;但短视频上智能体反而多用 20% 和 222% 的 token,并且方差极大。结论是智能体处理是一道按负载路由的决策题,而非静态处理的通用替代品。

🔑 核心要点

💡 金句

智能体视频理解给你的是一个新的有用控制旋钮,而不是一张停止测量的许可证。
← 返回 dev.to 首页