LACE-CRAFT:通过 Actor 继承与黑板协作实现机器人协同设计
LACE-CRAFT 提出机器人协同设计框架,通过 LACE 继承现有机器人的完整学习状态、以 actor 参数和观测统计初始化新形态策略,并由 CRAFT 协调反馈、形态、奖励与集成四类角色生成和交叉评审配对方案。
LACE-CRAFT 提出机器人协同设计框架,通过 LACE 继承现有机器人的完整学习状态、以 actor 参数和观测统计初始化新形态策略,并由 CRAFT 协调反馈、形态、奖励与集成四类角色生成和交叉评审配对方案。
研究团队提出多物体多目标抛掷(MOMT)规划框架,通过离线构建可行集模型、在线快速匹配与过滤,可在 5 ms 内生成多次抛掷序列。在 7 自由度机械臂配多指手上验证:仿真中双物体协同抛掷执行时间最多减少 46%,三物体仍保持该提升;真实实验双物体减少 29%。目标位置中途随机改变时,系统可在 100 ms 内重新规划并命中新目标,无需停机。
Go2-DrivoR 将端到端自动驾驶轨迹规划框架 DrivoR 适配到四足机器人城市导航,通过 goal token 以局部坐标系子目标为条件生成轨迹,并改写车辆中心评分公式,实现短时域目标条件局部规划。
geodex 是一个开源 C++20 库(含 Python 绑定),把流形、黎曼度量、retraction 与采样器拆成可互换组件,通过统一的基于采样的运动规划接口调用。同一规划器无需修改即可运行在 R^n、T^n、S^n、SO(2)、SE(2)、SO(3)、SE(3) 及其乘积空间和关节型机器人构型空间上,每个空间可配用户自定义黎曼度量。该库已公开,附带文档、测试与可复现基准套件。
Co²Skill 提出统一策略框架,将全身场景交互与灵巧物体操作整合进同一控制公式,基于预训练运动先验,用任务与阶段相关的观测掩码选择当前交互目标所需信息。该方法引入目标条件 loco-manipulation 课程与跨任务课程,支持跨任务边界保持物理状态与抓取,实现顺序任务执行及场景交互与操作同步进行。研究在坐、站、攀爬、上下楼梯及目标导向操作等任务上完成评估,并展示室内环境中的技能组合。
研究者提出 Ariadne,通过学习状态空间流形并利用其几何结构进行轨迹规划,训练仅需状态观测、无需专家轨迹数据。在 Maze2D 与机器人运动规划基准上,该方法能从纯状态监督中构建可行路径,并泛化到未见过的起点-终点组合。在高维双臂规划任务中,Ariadne 无需轨迹数据训练即可与轨迹监督方法和经典规划器保持竞争力,论文已被 NeurIPS 2026 接收。
针对独立设计的估计器在规划器信息条件下误差均值非零的问题,该研究提出一种信念空间规划方法,沿候选轨迹预测、传播并惩罚规划器条件估计误差,将仿射误差动态与保留随机修正不确定性的矩递推相结合。
针对机器人世界模型对动作变化不敏感、将已验证失败预测为成功的问题,CureWM 通过成功演示构建严重度网格上的反事实动作,经仿真或硬件执行验证结果后微调已发布模型。
MimicX 是一个策略在环框架,利用执行反馈精修视频驱动的人形机器人运动跟踪,通过定位困难过渡与受影响身体区域,联合调整跟踪目标与重置课程。在四项核心视频任务上,其任务平均身体跟踪误差降低 25.7%,可稳健执行时长提升 255.6%。MimicX-HLoop 进一步通过异构执行加速反馈。
研究者推出首个在开放无约束表面上实现闭环自主液滴导航的机器人平台,采用基于模型的强化学习,仅需 50 至 150 次物理实验即可完成策略训练,无需仿真或解析模型。该平台可零样本迁移至未见几何表面,并能自主发现振荡脱钉策略以解除液滴卡滞,完整训练流程在 90 分钟内完成。
Robo-COP 让 VLM 编排器与 VLA 策略在部署中共同进化,通过从自身执行中筛选技能演示、在数据能解决反复出现的失败时微调策略,并仅在新策略提升对应技能后才采纳。在十个 RoboLab 仿真任务上,平均留出成功率从冻结策略的 64.8% 提升至 73.8%,而固定计划微调无验证仅达 65.8%;在三个真实任务上从 38.3% 提升至 50.0%。
CERT-Replan 通过在线校准障碍物预测残差、以校准后的障碍风险作为重规划预警信号,在风险超出预算时切换更低风险的规划模式而非反复修正原计划。在非平稳基准中,其碰撞率较仅用安全滤波器降低 83.3%、较简单重规划触发降低 77.8%,安全滤波器平均干预减少 32.4%;配合 Trajectron++ 实现 96% 无碰撞运行,硬件实验与板载运行时分析验证了计算可行性。
RoboRender 将仿真轨迹转换为照片级真实 RGB 视频用于策略学习,以仿真深度视频、语言指令和机器人 RGB 掩码视频为条件,保留仿真器几何、机器人运动与动作标签。
ProAct 是一种策略无关的动作分词器训练方法,通过策略性增强重建目标来提升下游可预测性与鲁棒性,仅用动作数据集训练。在 Robomimic、LIBERO 和 RoboTwin 基准及多种分词器架构上,ProAct 将 rollout 成功率平均提升 11.3 个百分点;在 VLA 策略和真实机器人操作中分别平均提升 21.8 和 36.7 个百分点。
这篇综述系统梳理了因子图与场景图两类机器人世界模型如何应对真实环境的动态性,围绕表示方法、构建与更新流程、下游任务利用三个维度展开,并重点关注将两者结合的混合模型。文章归纳了常见架构模式,指出不确定性传播、最小感知下动态实体运动与尺度的可观测性、可扩展的终身维护,以及缺乏将世界模型质量与动态下游任务表现挂钩的数据集和评测协议等开放挑战。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习世界模型的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型状态输入梯度脆弱等问题。