银河通用与清华等提出 LATENT:用不完美人类动作数据让人形机器人学会网球对打
银河通用、清华大学、北京大学、上海启智研究院和上海人工智能实验室团队在 IROS 2026 提出 LATENT,用 5 名业余球员约 5 小时的不完美人体动作数据训练人形机器人网球对打。
银河通用、清华大学、北京大学、上海启智研究院和上海人工智能实验室团队在 IROS 2026 提出 LATENT,用 5 名业余球员约 5 小时的不完美人体动作数据训练人形机器人网球对打。
IROS 2026 共收录 1933 篇论文,其中 Robot Learning / Embodied AI 约 809 篇、Manipulation 520 篇、Humanoid / Legged 约 213 篇,VLA 相关约 82 篇。
IROS 2026 最佳论文奖颁给 LT-Mem,这项研究用 Live Memory、Delta Memory 和 Meta Memory 三层结构让机器人实现长期场景理解,应对时间性遗忘。
LACE-CRAFT 提出机器人协同设计框架,通过 LACE 继承现有机器人的完整学习状态、以 actor 参数和观测统计初始化新形态策略,并由 CRAFT 协调反馈、形态、奖励与集成四类角色生成和交叉评审配对方案。
研究团队提出多物体多目标抛掷(MOMT)规划框架,通过离线构建可行集模型、在线快速匹配与过滤,可在 5 ms 内生成多次抛掷序列。在 7 自由度机械臂配多指手上验证:仿真中双物体协同抛掷执行时间最多减少 46%,三物体仍保持该提升;真实实验双物体减少 29%。目标位置中途随机改变时,系统可在 100 ms 内重新规划并命中新目标,无需停机。
研究将两个机器人智能体在离散 2D 仿真器中协同演化出的通信机制迁移到带真实物理的 3D 仿真器,考察其功能角色能否保留。结果显示成功率随评估时间预算近似线性上升,在 2,000 至 6,000 物理步之间未见平台期,说明短回合评估可能低估控制器性能。两种仿真器中社交线索主要充当卡死协助机制而非导航引导,8 次独立演化运行呈现一致的对称性方向。
Go2-DrivoR 将端到端自动驾驶轨迹规划框架 DrivoR 适配到四足机器人城市导航,通过 goal token 以局部坐标系子目标为条件生成轨迹,并改写车辆中心评分公式,实现短时域目标条件局部规划。
ClimbLab 是一个开源的 MATLAB 仿真与分析平台,专为腿足攀爬机器人设计,可将任意肢体机器人系统建模为带浮动基座的铰接多体并进行行走与攀爬仿真。平台主要环境变量为倾角、重力和地面刚度,支持任意点云作为地形地图,并采用刚体动力学引擎。论文展示了四足机器人抓附墙面或攀爬陡坡的仿真示例。
研究提出基于 Vision-Language Models(VLMs)的上下文感知自适应喷洒框架,让机器人结合作物类型、农药类型与天气数据进行空间推理,自适应优化喷洒决策,并采用 MPPI 控制器实现精准导航与定点喷洒。
geodex 是一个开源 C++20 库(含 Python 绑定),把流形、黎曼度量、retraction 与采样器拆成可互换组件,通过统一的基于采样的运动规划接口调用。同一规划器无需修改即可运行在 R^n、T^n、S^n、SO(2)、SE(2)、SO(3)、SE(3) 及其乘积空间和关节型机器人构型空间上,每个空间可配用户自定义黎曼度量。该库已公开,附带文档、测试与可复现基准套件。
DexUMI 系列外骨骼的两种手部几何版本在相同机器人指令定义、映射流程和触觉模块下,改进版降低了操作者体力需求,并在基线版机械受阻的精密抓取中实现触觉采集。在开盖和开鸡蛋盒任务中,改进版演示训练的策略成功率高于基线版,空间加力输入也优于二值聚合输入。
研究者提出以关节运动学作为中间表示,将硬件特定传感与下游生物关节力矩估计解耦,估计器仅用开源生物力学数据训练。在髋外骨骼、膝外骨骼和 IMU 三种运动学输入下,平地、上坡和下坡行走的 RMSE 分别为 0.17、0.19、0.15 Nm/kg,R² 分别为 0.79、0.62、0.85。该框架有望减少目标设备数据采集,支持外骨骼控制与可穿戴生物力学的可迁移力矩估计。
HULK 是一个面向人形机器人全身强力运动操作的全身控制框架,通过 MPC 引导强化学习并蒸馏出单一策略,在仿真和宇树(Unitree)G1 上完成评估。仿真中,带捕获点控制障碍函数的教师模型在每臂 10 kg 负载下取得最低前向与侧向速度跟踪误差,并将 DCM 偏移幅度较纯 MPC 引导强化学习降低 35.7%;腕力教师可承受最高 130 N 的躯干推力扰动。
Co²Skill 提出统一策略框架,将全身场景交互与灵巧物体操作整合进同一控制公式,基于预训练运动先验,用任务与阶段相关的观测掩码选择当前交互目标所需信息。该方法引入目标条件 loco-manipulation 课程与跨任务课程,支持跨任务边界保持物理状态与抓取,实现顺序任务执行及场景交互与操作同步进行。研究在坐、站、攀爬、上下楼梯及目标导向操作等任务上完成评估,并展示室内环境中的技能组合。
研究评估了任务准入合并机制对去中心化多机器人任务分配器处理器负载与目标服务延迟的影响,采用 CBAA、ACBBA、PI 和 HIPC 四种 MRTA 算法,在 AGX Orin 与 Pololu 3pi+ RP2040 平台上开展实验。
研究提出一种证据驱动的人-智能体-机器人协同架构,用于深空乘组在地面支持缺失时的异常分诊:智能体 AI 作为有状态协调器管理假设、证据来源与不确定性,乘组侧具身智能体负责采集观察并解释评估变化,移动机器人获取局部证据。该架构在基于 Reachy Mini 与 Innate MARS 移动机器人的硬件在环集成原型中验证,并以 ISS 氨气误报和月球基地电源接口异常两个场景说明。
研究者提出 Entity-Level Goal Readout,一种从 3D trace 世界模型读出可执行终端目标的学习式预测到执行接口,将物体姿态预测与基于观测深度的平移结合,输出 SE(3) 紧凑目标。
PhysEvo 提出一种围绕单一冻结模型的物理递归自我改进框架,由任务智能体执行机器人任务、元智能体依据轨迹诊断失败并修订工具与技能,无需更新模型权重或单独训练动作策略。
研究者提出 Ariadne,通过学习状态空间流形并利用其几何结构进行轨迹规划,训练仅需状态观测、无需专家轨迹数据。在 Maze2D 与机器人运动规划基准上,该方法能从纯状态监督中构建可行路径,并泛化到未见过的起点-终点组合。在高维双臂规划任务中,Ariadne 无需轨迹数据训练即可与轨迹监督方法和经典规划器保持竞争力,论文已被 NeurIPS 2026 接收。
针对独立设计的估计器在规划器信息条件下误差均值非零的问题,该研究提出一种信念空间规划方法,沿候选轨迹预测、传播并惩罚规划器条件估计误差,将仿射误差动态与保留随机修正不确定性的矩递推相结合。
针对现有Token化机器人策略将离散Token视为无关类别索引、丢弃分词器潜在码本结构的问题,研究者提出码本对齐预测(CAP),直接复用分词器的码向量作为策略类别原型,分词器与策略主干保持不变。
针对机器人世界模型对动作变化不敏感、将已验证失败预测为成功的问题,CureWM 通过成功演示构建严重度网格上的反事实动作,经仿真或硬件执行验证结果后微调已发布模型。
SAFE 用两个被动 PVDF 声学传感器加电机本体感知,无需视觉和先验材料知识即可实时检测滑动与破碎,在留一抓取交叉验证下取得 0.884 的 Alert-F1,且几乎不混淆滑动与破碎。基于该检测层的自适应抓取控制器在 Jetson Orin Nano 上以 104 Hz 运行,46 次闭环机器人试验成功率达 91.3%,对训练中未见的新物体成功率为 82.4%。
CIRRA 是一个结合 LLM 语义推理与规则约束结构整合的双层框架,用于让机器人在执行任务中持续协调新指令,避免重新生成或大幅修改剩余任务序列。团队同时提出 CHIRP 基准,覆盖 8 类家庭环境和 6 类日常活动共 120 个回合,CIRRA 决策一致率达 74.2%,超出最强重规划基线 30 个百分点。
MimicX 是一个策略在环框架,利用执行反馈精修视频驱动的人形机器人运动跟踪,通过定位困难过渡与受影响身体区域,联合调整跟踪目标与重置课程。在四项核心视频任务上,其任务平均身体跟踪误差降低 25.7%,可稳健执行时长提升 255.6%。MimicX-HLoop 进一步通过异构执行加速反馈。
FlashNeRD 通过并行流式架构、可接受任意位置接触的编码器以及与解析求解器仿真物体的双向耦合,解决了 NeRD 速度提升有限、仅支持预定义接触点和缺乏双向耦合的三个局限。
研究者推出首个在开放无约束表面上实现闭环自主液滴导航的机器人平台,采用基于模型的强化学习,仅需 50 至 150 次物理实验即可完成策略训练,无需仿真或解析模型。该平台可零样本迁移至未见几何表面,并能自主发现振荡脱钉策略以解除液滴卡滞,完整训练流程在 90 分钟内完成。
Robo-COP 让 VLM 编排器与 VLA 策略在部署中共同进化,通过从自身执行中筛选技能演示、在数据能解决反复出现的失败时微调策略,并仅在新策略提升对应技能后才采纳。在十个 RoboLab 仿真任务上,平均留出成功率从冻结策略的 64.8% 提升至 73.8%,而固定计划微调无验证仅达 65.8%;在三个真实任务上从 38.3% 提升至 50.0%。
CERT-Replan 通过在线校准障碍物预测残差、以校准后的障碍风险作为重规划预警信号,在风险超出预算时切换更低风险的规划模式而非反复修正原计划。在非平稳基准中,其碰撞率较仅用安全滤波器降低 83.3%、较简单重规划触发降低 77.8%,安全滤波器平均干预减少 32.4%;配合 Trajectron++ 实现 96% 无碰撞运行,硬件实验与板载运行时分析验证了计算可行性。
RoboRender 将仿真轨迹转换为照片级真实 RGB 视频用于策略学习,以仿真深度视频、语言指令和机器人 RGB 掩码视频为条件,保留仿真器几何、机器人运动与动作标签。
ProAct 是一种策略无关的动作分词器训练方法,通过策略性增强重建目标来提升下游可预测性与鲁棒性,仅用动作数据集训练。在 Robomimic、LIBERO 和 RoboTwin 基准及多种分词器架构上,ProAct 将 rollout 成功率平均提升 11.3 个百分点;在 VLA 策略和真实机器人操作中分别平均提升 21.8 和 36.7 个百分点。
这篇综述系统梳理了因子图与场景图两类机器人世界模型如何应对真实环境的动态性,围绕表示方法、构建与更新流程、下游任务利用三个维度展开,并重点关注将两者结合的混合模型。文章归纳了常见架构模式,指出不确定性传播、最小感知下动态实体运动与尺度的可观测性、可扩展的终身维护,以及缺乏将世界模型质量与动态下游任务表现挂钩的数据集和评测协议等开放挑战。
Workhorse 让 Unitree G1 从无机器人的人类演示中学习全身移动操作,视觉规划器预测躯干、双腕和双脚五链路目标,强化学习全身跟踪器在机器人上执行,两条策略分别基于同一批人类姿态数据训练且无需重定向。
Noitom Robotics 发布 HiPHI,一个用光学动捕采集的 617.5 小时全身人体动作数据集,精度达亚毫米级,其中 245.7 小时为带同步物体轨迹与网格的人机物交互数据,并用 FrameNet 组织动作覆盖范围。白皮书同时提出用于衡量动作多样性与交互 grounding 的基准套件,并报告了在该数据集上训练的策略部署到实体 Unitree G1 人形机器人上的结果。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习世界模型的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型状态输入梯度脆弱等问题。