[论文解读] Offline RL with No OOD Actions: In-Sample Learning via Implicit Value Regularization
该论文提出了一种隐式价值正则化(IVR)框架,通过仅使用数据集动作隐式正则化价值函数,实现分布内(in-sample)离线强化学习,避免分布外(OOD)动作外推。该框架衍生出两种新算法——稀疏Q学习(SQL)和指数Q学习(EQL),通过引入稀疏性显著提升了对低质量数据的鲁棒性,尤其在噪声较大和数据量较小的场景下实现了最先进性能。
Most offline reinforcement learning (RL) methods suffer from the trade-off between improving the policy to surpass the behavior policy and constraining the policy to limit the deviation from the behavior policy as computing $Q$-values using out-of-distribution (OOD) actions will suffer from errors due to distributional shift. The recently proposed extit{In-sample Learning} paradigm (i.e., IQL), which improves the policy by quantile regression using only data samples, shows great promise because it learns an optimal policy without querying the value function of any unseen actions. However, it remains unclear how this type of method handles the distributional shift in learning the value function. In this work, we make a key finding that the in-sample learning paradigm arises under the extit{Implicit Value Regularization} (IVR) framework. This gives a deeper understanding of why the in-sample learning paradigm works, i.e., it applies implicit value regularization to the policy. Based on the IVR framework, we further propose two practical algorithms, Sparse $Q$-learning (SQL) and Exponential $Q$-learning (EQL), which adopt the same value regularization used in existing works, but in a complete in-sample manner. Compared with IQL, we find that our algorithms introduce sparsity in learning the value function, making them more robust in noisy data regimes. We also verify the effectiveness of SQL and EQL on D4RL benchmark datasets and show the benefits of in-sample learning by comparing them with CQL in small data regimes.
研究动机与目标
- 解决离线强化学习中因分布外(OOD)动作导致的策略性能与分布偏移之间的根本权衡问题。
- 通过统一的隐式价值正则化(IVR)框架,理解为何如IQL这样的分布内学习方法能够取得良好效果。
- 开发实用的分布内学习算法,在保持价值正则化的同时避免对OOD动作值的查询,从而在低数据量和噪声环境下提升鲁棒性。
- 证明在数据集中包含噪声或次优转移时,价值函数学习中的稀疏性可提升性能。
- 在标准D4RL基准和自定义的小样本/噪声数据场景下验证所提方法,结果优于CQL和IQL。
提出的方法
- 提出隐式价值正则化(IVR)框架,将策略学习建模为带有行为正则化项的约束优化问题。
- 证明在IVR框架下最优策略具有闭式解,表示为行为策略的加权混合,其中权重由状态值函数和动作值函数推导得出。
- 将难以计算的状态值函数问题转化为可通过数据集样本求解的凸优化问题,从而实现分布内学习。
- 将CQL和AWR中的现有价值正则化技术整合为完整的分布内学习范式,形成SQL和EQL算法。
- 通过设定阈值过滤掉Q值较低的动作,引入状态值函数的稀疏性,提升对噪声数据的鲁棒性。
- 仅在数据集动作上训练价值函数,消除对OOD动作值估计的依赖,降低外推误差。
实验结果
研究问题
- RQ1为何如IQL这样的分布内学习方法在避免查询OOD动作值的情况下仍能取得优异性能?
- RQ2能否构建一个统一的理论框架,解释分布内学习方法在离线强化学习中成功的原因?
- RQ3在噪声或低质量数据集中,引入价值函数学习中的稀疏性如何提升鲁棒性?
- RQ4在数据量小、状态覆盖有限的小样本场景下,分布内学习是否相比分布外学习具有性能优势?
- RQ5能否在不损失性能的前提下,将现有的价值正则化技术适配为完整的分布内学习框架?
主要发现
- IQL所采用的分布内学习范式可通过IVR框架得到形式化解释,该框架揭示IQL隐式应用了价值正则化,其正则化强度由超参数τ控制。
- 由IVR框架推导出的SQL和EQL在噪声数据场景下优于IQL:在Walker2d任务中专家数据仅占5%时,SQL和EQL达到接近专家的性能(≈100回报),而IQL性能急剧下降。
- 在小样本场景(如AntMaze中采用困难丢弃策略),CQL的Bellman误差呈指数增长(最高达300.5),回报降至0%,而SQL保持低误差(1.9)和高回报(24.2)。
- 在AntMaze基准的所有难度级别中,SQL和EQL的Bellman误差均低于CQL,表明由于采用分布内学习,其价值外推误差更小。
- SQL中引入的稀疏性通过过滤低质量动作,使方法对噪声转移更具鲁棒性,尤其在专家数据稀缺时表现更优。
- 在D4RL和Atari基准上,SQL和EQL均达到最先进性能,证实了在多样化离线强化学习场景中,结合隐式正则化的分布内学习具有显著优势。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。