Google I/O 2026 发布的 Gemini Omni 在作者看来是一次根本性转变:它不再只是文本进文本出的生成模型,而是面向视频生成与编辑的原生多模态引擎。作者有幸带着这项技术前往 GDG Calabar 进行分享。文章解释了 Gemini Omni 的核心能力——可以在单个提示词中同时输入文本、图像、视频和音频,取代了过去 Veo 等需要拼接多个独立模型的工作流,并反思了这种「原生多模态」对创作者和开发者工作流的革新意义。
🔑 核心要点
Gemini Omni 是 Google 的原生多模态模型,专为视频生成与编辑设计,取代了之前的 Veo。