研究了1933篇 IROS 论文,我们看到了机器人学的六项新变化
IROS 2026 共收录 1933 篇论文,其中 Robot Learning / Embodied AI 约 809 篇、Manipulation 520 篇、Humanoid / Legged 约 213 篇,VLA 相关约 82 篇。
IROS 2026 共收录 1933 篇论文,其中 Robot Learning / Embodied AI 约 809 篇、Manipulation 520 篇、Humanoid / Legged 约 213 篇,VLA 相关约 82 篇。
IROS 2026 最佳论文奖颁给 LT-Mem,这项研究用 Live Memory、Delta Memory 和 Meta Memory 三层结构让机器人实现长期场景理解,应对时间性遗忘。
研究者提出 Entity-Level Goal Readout,一种从 3D trace 世界模型读出可执行终端目标的学习式预测到执行接口,将物体姿态预测与基于观测深度的平移结合,输出 SE(3) 紧凑目标。
针对机器人世界模型对动作变化不敏感、将已验证失败预测为成功的问题,CureWM 通过成功演示构建严重度网格上的反事实动作,经仿真或硬件执行验证结果后微调已发布模型。
这篇综述系统梳理了因子图与场景图两类机器人世界模型如何应对真实环境的动态性,围绕表示方法、构建与更新流程、下游任务利用三个维度展开,并重点关注将两者结合的混合模型。文章归纳了常见架构模式,指出不确定性传播、最小感知下动态实体运动与尺度的可观测性、可扩展的终身维护,以及缺乏将世界模型质量与动态下游任务表现挂钩的数据集和评测协议等开放挑战。
斯坦福大学助理教授吴佳俊在 IROS 2026 的 RoBoWoMo 研讨会上发表题为《Building Physical Agents via Structured Representations》的受邀报告,提出结构化表征不是答案,而是机器人学会推理的脚手架。
NVIDIA 发布 Cosmos 3 Edge,这是 Cosmos 3 系列中的 4B 全模态模型,并配有基于 NVIDIA Nemotron 的 2B 推理器。官方称机器人需要能适配自身传感器、环境和任务并运行在板载算力上的策略,而世界模型虽为学习物理交互提供基础,但体积过大往往难以端侧部署,Cosmos 3 Edge 正是针对这一问题。
推荐理由:NVIDIA 官方给出 Cosmos 3 Edge 的参数量与推理器配置,读者可据此判断端侧部署的算力门槛。
NVIDIA 探讨世界动作模型(World Action Models)如何超越 VLA,让机器人策略不再局限于训练演示。传统策略在物体形状、位置或光照变化时往往失效,泛化到新条件需要策略理解任务背后的物理规律,而非单纯模仿演示。这一能力来自其骨干网络。
Berkeley AI Research 提出梯度规划器 GRASP,通过将轨迹提升到虚拟状态实现跨时间并行优化、在状态迭代上直接注入随机性以探索、并重塑梯度让动作获得清晰信号,从而让基于学习世界模型的长时程规划变得可行。该方法针对长时程 rollout 中梯度爆炸/消失、非贪心结构导致的局部极小值以及高维视觉模型状态输入梯度脆弱等问题。