arXiv cs.RO· Shangyuan Yuan, Xinda Qi, Yujiang Pu, Wenliang Guo, Xiaobo Tan·· 4 小时前
StairVLA:面向 VLA 模型的分阶段分层动作生成框架
StairVLA: Stage-Aware Hierarchical Action Generation for Vision-Language-Action Models
AI 导读
StairVLA 是一种分阶段感知的分层动作生成框架,利用部分去噪动作作为高层 VLA 粗粒度长程生成与轻量精化器局部修正之间的接口。在 LIBERO 上,其 GR00T 风格实例将平均成功率从 96.5% 提升至 97.8%,同时把每动作块的摊销推理延迟从 115.0 ms 降至 44.2 ms。该框架在两种 VLA 主干、仿真基准和真机任务上均能降低推理成本并保持任务性能。
来源:arXiv cs.RO · arxiv.org