Skip to main content
QUICK REVIEW

[论文解读] RRL: Resnet as representation for Reinforcement Learning

Rutav Shah, Vikash Kumar|arXiv (Cornell University)|Jul 7, 2021
Reinforcement Learning in Robotics被引用 5
一句话总结

RRL 提出在强化学习中使用预训练的 ResNet 特征作为视觉表征,从而实现仅从本体感觉输入(如摄像头和关节传感器)直接进行样本高效的策略学习。通过冻结在 ImageNet 上预训练的 ResNet-34 编码器,RRL 在复杂、接触丰富的操作任务(如 Adroit Manipulation)中实现了与使用完整状态信息的最先进方法相当的性能。

ABSTRACT

The ability to autonomously learn behaviors via direct interactions in uninstrumented environments can lead to generalist robots capable of enhancing productivity or providing care in unstructured settings like homes. Such uninstrumented settings warrant operations only using the robot's proprioceptive sensor such as onboard cameras, joint encoders, etc which can be challenging for policy learning owing to the high dimensionality and partial observability issues. We propose RRL: Resnet as representation for Reinforcement Learning -- a straightforward yet effective approach that can learn complex behaviors directly from proprioceptive inputs. RRL fuses features extracted from pre-trained Resnet into the standard reinforcement learning pipeline and delivers results comparable to learning directly from the state. In a simulated dexterous manipulation benchmark, where the state of the art methods fail to make significant progress, RRL delivers contact rich behaviors. The appeal of RRL lies in its simplicity in bringing together progress from the fields of Representation Learning, Imitation Learning, and Reinforcement Learning. Its effectiveness in learning behaviors directly from visual inputs with performance and sample efficiency matching learning directly from the state, even in complex high dimensional domains, is far from obvious.

研究动机与目标

  • 解决仅使用本体感觉传感器(如摄像头和关节编码器)在非结构化、真实世界环境中学习复杂行为的挑战。
  • 克服高维、部分可观察的视觉输入带来的问题,这些输入会阻碍真实世界机器人中样本高效的强化学习。
  • 通过利用通用的、预训练的视觉特征,减少对任务特定或环境仪器化状态表征的依赖。
  • 证明冻结的、预训练的 ResNet 特征可以在复杂、高维控制任务中达到与基于状态的强化学习相当的性能。

提出的方法

  • 将 ImageNet 上预训练的 ResNet-34 模型(已微调)用作固定视觉编码器,从原始 RGB 观测中提取特征。
  • 将冻结的 ResNet 特征直接集成到标准的在线策略强化学习算法(如 DAPG)中,无需任何微调或联合优化。
  • 利用 ImageNet 中广泛的真实世界图像分布,确保表征在策略训练过程中能泛化到各种真实世界的视觉分布。
  • 通过避免端到端联合优化策略和表征所引入的非平稳性,维持稳定的学习过程。
  • 在多个任务中使用相同的预训练编码器而无需重新训练,从而实现在具有相似视觉特征的新任务上的零样本迁移。
  • 仅使用视觉观测(无状态信息),并避免使用任务特定的数据增强或表征预训练。

实验结果

研究问题

  • RQ1预训练的 ResNet 特征能否作为真实世界机器人控制中端到端强化学习的有效、通用视觉表征?
  • RQ2与联合学习表征和策略相比,使用固定预训练编码器是否能提升样本效率和训练稳定性?
  • RQ3在最先进方法难以取得显著进展的复杂、接触丰富的操作任务中,RRL 的表现如何?
  • RQ4从 ImageNet 学习到的表征在具有多样化视觉分布的任务之间泛化程度如何,尤其与任务特定表征相比?
  • RQ5单一冻结的表征是否能在无需额外预训练的情况下,有效实现跨多样化、高维机器人控制任务的迁移?

主要发现

  • 在 Adroit Manipulation 基准测试中,RRL 的性能与使用完整状态信息的最先进方法相当,该基准是一个复杂、接触丰富的灵巧操作套件。
  • 在 DMControl 基准测试中,RRL 在 100K 和 500K 环境步数下的表现不如 RAD 和 SAC+AE 等任务特定方法,表明在简单、低复杂度环境中,任务特定表征更具样本效率。
  • 任务特定表征(如在 CartPole 上预训练的 RAD 编码器)在其他 DMControl 环境中的性能显著下降,表明其在任务间泛化能力差。
  • RRL 使用固定、预训练的 ResNet-34 编码器带来了更稳定的学习过程,并避免了联合表征与策略训练中常见的非平稳性问题。
  • 通过消除从零开始训练表征头的需求,RRL 实现了显著的样本和计算资源节省,如图 5 所示。
  • 结果凸显了模拟基准(如 DMControl)与真实世界机器人任务之间存在巨大的领域差距,提示未来强化学习研究需要更真实的基准。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。