Skip to main content
QUICK REVIEW

[论文解读] Rotation, Translation, and Cropping for Zero-Shot Generalization

Chang Ye, Ahmed Khalifa|arXiv (Cornell University)|Jan 27, 2020
Reinforcement Learning in Robotics参考文献 25被引用 10
一句话总结

本文提出,对视觉观测进行旋转、平移和裁剪,可显著提升在2D街机游戏上训练的深度强化学习智能体的零样本泛化能力。通过采用以智能体为中心、面向前方的视角,智能体在仅使用少量训练数据的情况下,即可在未见过的程序化生成关卡上实现高达90%的成功率,优于标准的固定视角方法。

ABSTRACT

Deep Reinforcement Learning (DRL) has shown impressive performance on domains with visual inputs, in particular various games. However, the agent is usually trained on a fixed environment, e.g. a fixed number of levels. A growing mass of evidence suggests that these trained models fail to generalize to even slight variations of the environments they were trained on. This paper advances the hypothesis that the lack of generalization is partly due to the input representation, and explores how rotation, cropping and translation could increase generality. We show that a cropped, translated and rotated observation can get better generalization on unseen levels of two-dimensional arcade games from the GVGAI framework. The generality of the agents is evaluated on both human-designed and procedurally generated levels.

研究动机与目标

  • 探究旋转、平移和裁剪等感知变换是否能提升深度强化学习智能体的零样本泛化能力。
  • 挑战固定、静态第三人称视角会阻碍深度强化学习在视频游戏中的泛化能力这一假设。
  • 评估这些变换在人工设计关卡和程序化生成关卡上的有效性。
  • 证明输入表征在实现鲁棒、可泛化的策略中起着关键作用。
  • 形式化提出基于数据增强的实用设计原则,用于强化学习中的观测空间工程。

提出的方法

  • 作者在训练过程中对深度强化学习智能体的视觉输入应用数据增强技术——旋转、平移和裁剪。
  • 将观测空间转换为模拟第一人称、以智能体为中心的视角,使智能体始终面向前方。
  • 智能体使用A2C算法在GVGAI框架的五个小关卡上进行训练。
  • 通过在人工设计关卡和程序化生成关卡上的评估,检验零样本泛化性能。
  • 该方法避免架构改动,仅通过输入变换来隔离其对泛化能力的影响。
  • 该方法在多个游戏中进行了评估,包括Zelda、SolarFox和Boulderdash,以检验其可迁移性。

实验结果

研究问题

  • RQ1通过旋转、平移和裁剪变换输入观测,是否能提升深度强化学习智能体的零样本泛化能力?
  • RQ2是否简单的感知变换即可显著优于标准的固定第三人称视角?
  • RQ3这些变换在不同全局状态依赖程度的游戏中的表现如何变化?
  • RQ4这些技术在多大程度上降低了在有限训练数据上训练的策略的脆弱性?
  • RQ5这些输入层面的修改能否作为架构或算法创新的实用、低成本替代方案,以提升泛化能力?

主要发现

  • 在仅训练五个关卡的情况下,采用旋转、平移和裁剪训练的智能体在未见过的程序化生成关卡上实现了高达90%的成功率。
  • 该方法显著优于标准的固定第三人称观测设置,尤其在高度随机的环境中表现更优。
  • 在Zelda和SolarFox等以局部物体交互为主导的游戏中的改进最为显著。
  • 在需要全局意识的游戏(如敌人随时间变强的游戏)中,裁剪降低了性能,因其导致上下文信息丢失。
  • 在缺乏明确朝向方向的游戏里,旋转无效,凸显其对智能体朝向语义的依赖性。
  • 神经网络常聚焦于无关细节(如得分板),表明需要引入注意力机制或选择性过滤以提升对显著特征的关注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。