Skip to main content
QUICK REVIEW

[论文解读] Zero-Shot Reinforcement Learning with Deep Attention Convolutional Neural Networks

Şahika Genç, Sunil Mallya|arXiv (Cornell University)|Jan 2, 2020
Domain Adaptation and Few-Shot Learning参考文献 32被引用 7
一句话总结

本文提出一种深度注意力卷积神经网络(DACNN),通过注意力机制联合优化感知与控制,实现零样本强化学习,在显著降低计算成本的前提下,达到与领域随机化基线相当的性能。该模型无需预训练或真实世界微调即可学习聚焦于任务相关的视觉特征,从而在自动驾驶任务中实现鲁棒的仿真到现实迁移。

ABSTRACT

Simulation-to-simulation and simulation-to-real world transfer of neural network models have been a difficult problem. To close the reality gap, prior methods to simulation-to-real world transfer focused on domain adaptation, decoupling perception and dynamics and solving each problem separately, and randomization of agent parameters and environment conditions to expose the learning agent to a variety of conditions. While these methods provide acceptable performance, the computational complexity required to capture a large variation of parameters for comprehensive scenarios on a given task such as autonomous driving or robotic manipulation is high. Our key contribution is to theoretically prove and empirically demonstrate that a deep attention convolutional neural network (DACNN) with specific visual sensor configuration performs as well as training on a dataset with high domain and parameter variation at lower computational complexity. Specifically, the attention network weights are learned through policy optimization to focus on local dependencies that lead to optimal actions, and does not require tuning in real-world for generalization. Our new architecture adapts perception with respect to the control objective, resulting in zero-shot learning without pre-training a perception network. To measure the impact of our new deep network architecture on domain adaptation, we consider autonomous driving as a use case. We perform an extensive set of experiments in simulation-to-simulation and simulation-to-real scenarios to compare our approach to several baselines including the current state-of-art models.

研究动机与目标

  • 解决强化学习在机器人领域中仿真到现实的领域差距问题,且无需真实世界微调。
  • 克服基于仿真训练中领域与参数随机化带来的高计算成本问题。
  • 通过学习注意力驱动的特征加权,统一感知与控制,使其与控制目标对齐。
  • 仅使用仿真数据,实现视觉控制任务(如自动驾驶)中的零样本泛化。
  • 证明卷积神经网络中的注意力机制可捕捉类似无源性的系统特性,从而在无需显式动力学建模的情况下实现稳定控制。

提出的方法

  • 提出一种深度注意力卷积神经网络(DACNN),通过多层卷积神经网络处理原始图像观测,随后应用注意力机制。
  • 将图像特征定义为从预训练卷积神经网络中提取的标注向量,使注意力网络能够聚焦于相关的视觉组件。
  • 使用策略优化训练注意力网络,使其对最小化全图误差的局部图像特征进行加权,直接将感知与控制目标关联。
  • 利用球面相机几何结构和固定方向的标注向量,保持动态系统中的类似无源性特性,确保系统稳定性。
  • 使用近端策略优化(PPO)端到端训练整个DACNN,采用奖励函数激励自动驾驶仿真中的路径居中与高速行驶。
  • 避免分离的感知与控制模块,而是通过注意力驱动的特征选择联合优化两者,使其自适应于控制目标。

实验结果

研究问题

  • RQ1端到端注意力驱动的卷积神经网络架构是否能在计算成本显著降低的前提下,实现与领域随机化基线相当的零样本强化学习性能?
  • RQ2在卷积神经网络策略网络中采用注意力驱动的特征加权,是否能在无需真实世界微调的情况下,提升在领域偏移(如光照、纹理)下的泛化能力?
  • RQ3视觉控制策略中的注意力机制是否能保持类似无源性的系统特性,从而在不同视觉条件下实现稳定控制?
  • RQ4在仿真到仿真与仿真到现实的场景中,DACNN架构与DARLA等多阶段智能体相比,其训练收敛速度与样本效率如何?
  • RQ5注意力单元数量与批量大小的选择在多大程度上影响DACNN框架中的学习速度与最终性能?

主要发现

  • 尽管无需感知预训练阶段,DACNN的训练收敛速度与最先进多阶段智能体DARLA相当。
  • 使用批量大小64的训练收敛速度优于批量大小32,将注意力单元数量从64增加到256可进一步提升学习速度与稳定性。
  • DACNN模型在无需任何真实世界微调的情况下,仍能在仿真到仿真与仿真到现实的迁移任务中保持高性能,展现出真正的零样本泛化能力。
  • 注意力机制能有效过滤干扰项(如偏离路径的物体),并聚焦于相关视觉线索(如道路边界),如可视化对比所示。
  • 由于底层卷积神经网络的不变性特性与注意力驱动的特征选择,模型对纹理与光照变化具有鲁棒性。
  • 在需要广泛领域泛化的场景中,DACNN在样本效率与计算成本方面均优于基线方法。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。