[论文解读] Observational Overfitting in Reinforcement Learning
本文提出了强化学习中的观测过拟合现象,即智能体过度拟合观测中的虚假特征,而非底层马尔可夫决策过程(MDP)的动力学。通过仅修改固定MDP的观测空间,作者在线性(LQR)和非线性(MLP、CNN)策略中均发现了隐式正则化现象,且过参数化能提升泛化性能——这挑战了现有基于监督学习(SL)的泛化界在强化学习中的适用性。
A major component of overfitting in model-free reinforcement learning (RL) involves the case where the agent may mistakenly correlate reward with certain spurious features from the observations generated by the Markov Decision Process (MDP). We provide a general framework for analyzing this scenario, which we use to design multiple synthetic benchmarks from only modifying the observation space of an MDP. When an agent overfits to different observation spaces even if the underlying MDP dynamics is fixed, we term this observational overfitting. Our experiments expose intriguing properties especially with regards to implicit regularization, and also corroborate results from previous works in RL generalization and supervised learning (SL).
研究动机与目标
- 将观测过拟合作为导致强化学习泛化性能不佳的独立原因进行隔离与分析,排除动力学或架构因素的干扰。
- 构建一个合成基准框架,固定MDP动力学但仅改变观测空间,以研究观测过拟合现象。
- 探究在观测过拟合条件下,强化学习中是否会出现隐式正则化,尤其是针对过参数化的策略。
- 评估标准泛化度量(如范数、间隔)在观测过拟合设置下预测强化学习泛化性能的有效性。
- 通过展示监督学习泛化界在观测过拟合场景下的松散性,挑战其在强化学习中的适用性。
提出的方法
- 通过仅修改固定底层MDP的观测函数,构建一组MDP,同时保持动力学和奖励结构不变。
- 使用线性二次调节器(LQR)与线性策略,通过梯度下降分析观测过拟合下的泛化性能。
- 将该框架应用于经典Gym环境(如CartPole、LunarLander),采用MLP和卷积神经网络策略研究非线性情形。
- 在不同观测分布上训练智能体,并在未见过的观测变体上评估零样本性能,以衡量泛化能力。
- 通过权重范数动态与间隔分布分析隐式正则化,与标准SL风格泛化界进行比较。
- 评估泛化度量(如谱-Frobenius范数、与初始化的距离)并检验其与观测过拟合场景下测试性能的相关性。
实验结果
研究问题
- RQ1当底层MDP动力学保持不变但观测分布变化时,是否会发生观测过拟合,导致零样本泛化性能下降?
- RQ2在观测过拟合条件下,强化学习中隐式正则化在多大程度上出现,尤其是针对过参数化的神经网络?
- RQ3监督学习中的标准泛化度量(如权重范数、间隔分布)能否有效预测强化学习在观测过拟合下的泛化性能?
- RQ4架构选择(如MLP与CNN)以及观测模态(如显著性图、遮挡)如何影响观测过拟合中的泛化性能?
- RQ5监督学习中的现有泛化界在强化学习观测过拟合情境下是否仍保持紧致或具有信息量?
主要发现
- 在LQR设置中,即使采用精确优化,线性策略与梯度下降下观测过拟合仍必然导致泛化差距。
- 在CoinRun环境中,过参数化的MLP在观测过拟合下表现出更好的泛化性能,即使每关卡的MDP动力学不同,表明隐式正则化支持泛化。
- 在《刺猬索尼克》中遮挡计分板使测试性能提升10%(NatureCNN从1052提升至1141,IMPALA从1130提升至1250),表明智能体过度拟合了虚假视觉线索。
- 原始权重范数在训练过程中单调递增,且无法预测泛化性能,表明标准SL风格的基于范数的界对强化学习而言过松。
- 间隔分布训练后收敛至固定形式,但其与强化学习泛化性能的相关性弱于监督学习,表明强化学习中存在不同的归纳偏置。
- 谱-Frobenius范数与与初始化距离等度量相较于原始范数能更好预测泛化性能,但仍不足以完全解释强化学习中过参数化效应。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。