教 Antigravity 做视频导演:基于 Gemini 交互 API 的有状态视频编辑技能
来源:dev.to — 2026-07-24
📋 概述
作者将 Google 的 Gemini Omni Flash 视频生成模型封装为一个 Antigravity CLI 技能兼 MCP 服务器。用户输入文字即可生成视频,然后通过多轮对话迭代编辑同一段视频——无需重新描述整个场景。支持文生视频、图片动画化、关键帧插值、视频重风格化,完成后可一键上传 YouTube。
🔑 核心要点
- 封装 Gemini Omni Flash 模型为 Antigravity CLI 技能和 MCP 服务器
- 利用 Gemini Interactions API 实现有状态多轮视频编辑——模型在服务端保持视觉上下文
- 支持 5 种视频生成方式:文字→视频、图片→视频、关键帧插值、视频重风格化、图片动画化
- 8 种工具调用(tool calls)覆盖视频生成全流程,包括 YouTube 上传
- 与大多数视频工作流不同,无需重新描述整个场景即可迭代编辑同一视频
- 所有操作在终端完成,零浏览器交互
💡 金句
你说「生成一只狐狸在雪中奔跑的视频」,它就照做了。然后你说「改成夜晚,加上飘雪」,它就编辑同一段视频,不需要重新描述整个场景。
👍 0
👎 0
← 返回 Dev.to 首页