银河通用与清华等提出 LATENT:用不完美人类动作数据让人形机器人学会网球对打
银河通用、清华大学、北京大学、上海启智研究院和上海人工智能实验室团队在 IROS 2026 提出 LATENT,用 5 名业余球员约 5 小时的不完美人体动作数据训练人形机器人网球对打。
银河通用、清华大学、北京大学、上海启智研究院和上海人工智能实验室团队在 IROS 2026 提出 LATENT,用 5 名业余球员约 5 小时的不完美人体动作数据训练人形机器人网球对打。
研究将两个机器人智能体在离散 2D 仿真器中协同演化出的通信机制迁移到带真实物理的 3D 仿真器,考察其功能角色能否保留。结果显示成功率随评估时间预算近似线性上升,在 2,000 至 6,000 物理步之间未见平台期,说明短回合评估可能低估控制器性能。两种仿真器中社交线索主要充当卡死协助机制而非导航引导,8 次独立演化运行呈现一致的对称性方向。
HULK 是一个面向人形机器人全身强力运动操作的全身控制框架,通过 MPC 引导强化学习并蒸馏出单一策略,在仿真和宇树(Unitree)G1 上完成评估。仿真中,带捕获点控制障碍函数的教师模型在每臂 10 kg 负载下取得最低前向与侧向速度跟踪误差,并将 DCM 偏移幅度较纯 MPC 引导强化学习降低 35.7%;腕力教师可承受最高 130 N 的躯干推力扰动。
MimicX 是一个策略在环框架,利用执行反馈精修视频驱动的人形机器人运动跟踪,通过定位困难过渡与受影响身体区域,联合调整跟踪目标与重置课程。在四项核心视频任务上,其任务平均身体跟踪误差降低 25.7%,可稳健执行时长提升 255.6%。MimicX-HLoop 进一步通过异构执行加速反馈。
FlashNeRD 通过并行流式架构、可接受任意位置接触的编码器以及与解析求解器仿真物体的双向耦合,解决了 NeRD 速度提升有限、仅支持预定义接触点和缺乏双向耦合的三个局限。
研究者推出首个在开放无约束表面上实现闭环自主液滴导航的机器人平台,采用基于模型的强化学习,仅需 50 至 150 次物理实验即可完成策略训练,无需仿真或解析模型。该平台可零样本迁移至未见几何表面,并能自主发现振荡脱钉策略以解除液滴卡滞,完整训练流程在 90 分钟内完成。
Robo-COP 让 VLM 编排器与 VLA 策略在部署中共同进化,通过从自身执行中筛选技能演示、在数据能解决反复出现的失败时微调策略,并仅在新策略提升对应技能后才采纳。在十个 RoboLab 仿真任务上,平均留出成功率从冻结策略的 64.8% 提升至 73.8%,而固定计划微调无验证仅达 65.8%;在三个真实任务上从 38.3% 提升至 50.0%。
Workhorse 让 Unitree G1 从无机器人的人类演示中学习全身移动操作,视觉规划器预测躯干、双腕和双脚五链路目标,强化学习全身跟踪器在机器人上执行,两条策略分别基于同一批人类姿态数据训练且无需重定向。
Noitom Robotics 发布 HiPHI,一个用光学动捕采集的 617.5 小时全身人体动作数据集,精度达亚毫米级,其中 245.7 小时为带同步物体轨迹与网格的人机物交互数据,并用 FrameNet 组织动作覆盖范围。白皮书同时提出用于衡量动作多样性与交互 grounding 的基准套件,并报告了在该数据集上训练的策略部署到实体 Unitree G1 人形机器人上的结果。