π 系列 VLA:从 π0 到 π0.7,机器人基础模型的四步演进
通读 Physical Intelligence 的 π0、π0.5、π*0.6(RECAP)与 π0.7 四篇论文,推导流匹配动作专家、分层推理、优势条件化 RL 与多模态提示这四块拼图如何组成一条完整的机器人基础模型路线。
具身智能
分类
4篇文章
通读 Physical Intelligence 的 π0、π0.5、π*0.6(RECAP)与 π0.7 四篇论文,推导流匹配动作专家、分层推理、优势条件化 RL 与多模态提示这四块拼图如何组成一条完整的机器人基础模型路线。
从动觉示教到 ALOHA、从手持夹爪到人类视频、从跨本体聚合到自主数据飞轮——沿着"吞吐量与保真度不可兼得"这条主线,梳理具身智能数据获取的每一次范式转移及其代价。
从奖励函数逐项设计和大规模并行仿真讲起,拆解执行器建模、域随机化与教师-学生蒸馏这三件让 RL 策略真正跑上实机的事。
从行为克隆的复合误差与多模态困境出发,推导 ACT 的 CVAE 动作分块与 Diffusion Policy 的去噪生成各自如何解决这两个问题,以及工程上如何二选一。