VLA 机器人操作
视觉-语言-动作(VLA)模型在真机机械臂上的实践
视觉-语言-动作(VLA)模型把自然语言指令与视觉观测直接映射为机器人动作,是具身智能当前最重要的技术路线之一。它把“感知—语言—控制”放进同一个模型中,让机器人能跟随语言指令完成操作,而不必为每个任务单独写控制程序。
这一段是我第一份工作期间的主要方向。下面是我当时保留下来的真机演示录像。
围绕这条路线的学习笔记,我整理成了博客里的一个系列:
- Pi 系列 VLA 原理解析 —— VLA 机器人基础模型的架构与训练范式;
- ACT 与 Diffusion Policy 原理解析 —— 模仿学习的两个代表性工作;
- 具身智能数据获取的演进 —— 从遥操作到跨本体数据聚合的数据飞轮。