跳到正文
热点事件持续更新

TRQAM:稳定离线强化学习微调算法

1 篇报道1 个报道来源4 小时前更新

先了解这件事

报道摘要

针对 QAM 因 critic 误差被指数放大而导致性能崩溃的问题,研究者提出 TRQAM,通过在流策略采样过程中引入信赖域参数 λ 并证明其恰好加权 SOC 目标中的路径空间 KL,实现对预训练策略偏离的精确控制。在 50 个 OGBench 任务上,TRQAM 离线 RL 整体成功率达 68%,显著优于最强基线 46%,并在离线到在线 RL 中持续领先。

摘自 arXiv cs.RO

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv cs.RO
    TRQAM:基于信赖域 Q 伴随匹配的稳定离线策略微调算法

    针对 QAM 因 critic 误差被指数放大而导致性能崩溃的问题,研究者提出 TRQAM,通过在流策略采样过程中引入信赖域参数 λ 并证明其恰好加权 SOC 目标中的路径空间 KL,实现对预训练策略偏离的精确控制。在 50 个 OGBench 任务上,TRQAM 离线 RL 整体成功率达 68%,显著优于最强基线 46%,并在离线到在线 RL 中持续领先。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。