跳到正文
孔乙己

返回成果

VLA 机器人操作

视觉-语言-动作(VLA)模型在真机机械臂上的实践

我的角色第一份工作
状态真机演示录像
技术栈Python · PyTorch · ROS · VLA · 模仿学习

视觉-语言-动作(VLA)模型把自然语言指令与视觉观测直接映射为机器人动作,是具身智能当前最重要的技术路线之一。它把“感知—语言—控制”放进同一个模型中,让机器人能跟随语言指令完成操作,而不必为每个任务单独写控制程序。

这一段是我第一份工作期间的主要方向。下面是我当时保留下来的真机演示录像。

真机演示录像 1。
真机演示录像 2。
真机演示录像 3。
真机演示录像 4。

围绕这条路线的学习笔记,我整理成了博客里的一个系列: