跳到正文
arXiv cs.RO· Yonghoon Dong, Kyungmin Lee, Changyeon Kim, Jaehyuk Kim, Jinwoo Shin·· 4 小时前

TRQAM:基于信赖域 Q 伴随匹配的稳定离线策略微调算法

Trust Region Q Adjoint Matching

AI 导读

针对 QAM 因 critic 误差被指数放大而导致性能崩溃的问题,研究者提出 TRQAM,通过在流策略采样过程中引入信赖域参数 λ 并证明其恰好加权 SOC 目标中的路径空间 KL,实现对预训练策略偏离的精确控制。在 50 个 OGBench 任务上,TRQAM 离线 RL 整体成功率达 68%,显著优于最强基线 46%,并在离线到在线 RL 中持续领先。

来源:arXiv cs.RO · arxiv.org