跳到正文
arXiv cs.RO· Zuyao Lin, Jianhui Zhang, Peidong Jia, Xiaoguang Zhao, Shanghang Zhang, Jingdong Wang, Xingyu Chen·· 4 小时前

World-Ego Model(WEM):解耦世界与自我建模的具身视频生成,面向长时程导航-操作任务

World-Ego Modeling for Embodied Video Generation in Long-Horizon Navigation-Manipulation Tasks

AI 导读

研究者提出 World-Ego Model(WEM),将具身视频拆分为"世界"(背景与未被操作物体)和"自我"(机器人与被操作物体)并解耦生成过程,结合角色条件注意力(RCA)的视觉-语言状态预测器与语义路由混合专家(SR-MoE)扩散生成器。

来源:arXiv cs.RO · arxiv.org