跳到正文
arXiv cs.RO· Lemon Foxmere, Anthony Furman, Yizheng Du, Oliver Chang, Leilani Gilpin, Steve McGuire·· 2 天前

用强化学习与模仿学习结合对抗任务选择,让 Unitree B1 四足机器人学会 22 项技能

Teaching a Robot Dog New Tricks: Diverse Quadruped Skills via Combined Reinforcement and Imitation Learning with Adversarial Task Selection

AI 导读

研究者提出三阶段方法,用 8 个教师策略训练出能执行 22 项任务的单一学生策略,涵盖行走、挖掘、跳跃,并可组合出爬行等新行为。该方法采用多教师蒸馏,结合强化学习与模仿学习目标,并通过对抗任务选择聚焦最差任务。评估显示其运动质量与指令跟踪优于 PPO 和 distill-then-finetune 基线,部分新任务无需显式训练即可泛化,并已在 Unitree B1 四足机器人上完成真实部署。

来源:arXiv cs.RO · arxiv.org