视觉-语言-动作模型:当大语言模型学会使用双手
来源:dev.to — 2026-07-25
📋 概述
一只仿生手握住酒杯需要每 8-20 毫秒更新一次动作估计,否则要么捏碎杯子要么松手掉落。而视觉语言模型处理同一场景可以悠闲地花 100 毫秒无人察觉。NVIDIA GR00T N1.7、Google DeepMind Gemini Robotics 1.5 和 Physical Intelligence pi-zero-point-five 三款最新 VLA 模型同期发布,都自称通用操作机器人系统,却在思考和行动的缝合点上做出了不同的架构选择。
🔑 核心要点
- VLA 的核心挑战是推理速度与动作频率的鸿沟——VLM 推理 100ms vs 机器人控制需要 8-20ms
- NVIDIA GR00T N1.7 将推理和动作分开到两个网络和两个时钟上运行
- Gemini Robotics 1.5 把缝合点放在时间轴上——用语言推理→行动→再推理的循环
- pi-zero-point-five 尝试完全消除推理-动作分离,将两者融合到一个 transformer 中让注意力机制协调
💡 金句
A humanoid hand closing on a wine glass needs a new action estimate every 8 to 20 milliseconds, or it either crushes the glass or drops it.
👍 0
👎 0
← 返回 Dev.to 首页