[论文解读] Robust Visual Domain Randomization for Reinforcement Learning
该论文提出了一种正则化方法,即在单一环境变体上训练智能体,同时强制其学习的状态表征在视觉域随机化下保持不变。通过最小化不同视觉随机化下同一状态的特征之间的L2距离,该方法在样本效率和鲁棒性方面优于标准域随机化,且在未见视觉域上的泛化性能相当或更优。
Producing agents that can generalize to a wide range of visually different environments is a significant challenge in reinforcement learning. One method for overcoming this issue is visual domain randomization, whereby at the start of each training episode some visual aspects of the environment are randomized so that the agent is exposed to many possible variations. However, domain randomization is highly inefficient and may lead to policies with high variance across domains. Instead, we propose a regularization method whereby the agent is only trained on one variation of the environment, and its learned state representations are regularized during training to be invariant across domains. We conduct experiments that demonstrate that our technique leads to more efficient and robust learning than standard domain randomization, while achieving equal generalization scores.
研究动机与目标
- 解决标准视觉域随机化在强化学习中效率低下且方差高的问题。
- 在无需真实世界数据的情况下,提升对未见视觉域的泛化能力。
- 减少训练过程中对特定视觉环境的过拟合。
- 开发一种方法,使状态表征在视觉域变化下保持不变。
- 为中间网络层的不变性而非策略输出的不变性提供理论和实证支持。
提出的方法
- 智能体仅在具有固定视觉属性(例如特定背景颜色)的参考环境中进行训练。
- 训练过程中,正则化项会惩罚同一状态在不同视觉随机化下的特征表征差异。
- 正则化应用于神经网络的中间层,而非策略输出,以鼓励状态表征的不变性。
- 该方法采用双输入前向传播:一个使用参考环境,另一个使用同一状态的随机采样视觉变体。
- 损失函数结合了标准强化学习损失(如Q-learning或策略梯度)与基于L2距离的对比正则化项。
- 该方法与基于值函数(如DQN)和基于策略梯度(如PPO)的强化学习算法均兼容。
实验结果
研究问题
- RQ1对中间状态表征进行正则化是否能在不增加样本复杂度的前提下提升视觉域随机化中的泛化性能?
- RQ2特征表征的不变性如何影响策略在未见视觉域变化下的鲁棒性?
- RQ3在中间层进行正则化是否优于在策略输出上正则化或对输入进行扰动?
- RQ4与标准域随机化相比,该方法在训练效率和性能方差方面表现如何?
- RQ5正则化对特征空间结构的影响如何?通过跨域表征的t-SNE可视化进行测量。
主要发现
- 正则化智能体在泛化性能上与标准域随机化相当,但在不同视觉域上的方差显著更低。
- t-SNE可视化显示,正则化智能体对多样化视觉域学习到相似的表征,而随机化智能体则为不同域学习到不同的表征。
- 正则化智能体能稳健地泛化到未见的视觉随机化(例如训练集中未包含的背景颜色),而随机化智能体在特征表征上表现出高方差。
- 正则化减少了对特定视觉配置的过拟合,表现为在广泛背景颜色下性能保持一致。
- 正则化带来了更高效的训练,因为智能体无需在轨迹中经历所有视觉变体。
- 理论分析表明,所提出的正则化改善了策略对视觉随机化的Lipschitz连续性,从而增强了鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。