足式机器人强化学习:sim-to-real 的鸿沟到底怎么跨从奖励函数逐项设计和大规模并行仿真讲起,拆解执行器建模、域随机化与教师-学生蒸馏这三件让 RL 策略真正跑上实机的事。2026年9月4日具身智能