Skip to main content
QUICK REVIEW

[论文解读] Equivariant $Q$ Learning in Spatial Action Spaces

Dian Wang, Robin Walters|arXiv (Cornell University)|Oct 28, 2021
Robot Manipulation and Learning参考文献 39被引用 4
一句话总结

本论文通过利用视觉状态和动作中的 SE(2) 对称性,提出了一种用于空间动作空间的等变 Q-learning 方法,采用可导向卷积网络强制实现等变性。该方法在样本效率方面显著优于标准深度 Q-learning,在机器人操作任务(包括真实世界部署)中实现了最先进性能。

ABSTRACT

Recently, a variety of new equivariant neural network model architectures have been proposed that generalize better over rotational and reflectional symmetries than standard models. These models are relevant to robotics because many robotics problems can be expressed in a rotationally symmetric way. This paper focuses on equivariance over a visual state space and a spatial action space -- the setting where the robot action space includes a subset of $ m{SE}(2)$. In this situation, we know a priori that rotations and translations in the state image should result in the same rotations and translations in the spatial action dimensions of the optimal policy. Therefore, we can use equivariant model architectures to make $Q$ learning more sample efficient. This paper identifies when the optimal $Q$ function is equivariant and proposes $Q$ network architectures for this setting. We show experimentally that this approach outperforms standard methods in a set of challenging manipulation problems.

研究动机与目标

  • 确定最优 Q 函数在 SE(2) 变换(旋转和平移)下保持等变性的条件。
  • 设计能够对空间动作空间中的 Q 函数强制实现 SE(2) 等变性的神经网络架构。
  • 开发部分等变模型,以适应机器人中常见的状态变量部分对称性。
  • 在具有挑战性的视觉-运动控制任务上,对所提方法与非等变基线进行实证评估。
  • 在仿真和真实世界机器人部署中,展示泛化能力和样本效率的提升。

提出的方法

  • 形式化有限子群作用下最优 Q 函数在 SE(2) 下保持等变的条件,确保视觉状态空间中的变换在动作空间中产生对应变换。
  • 使用显式编码 SE(2) 等变性的可导向卷积层设计 Q-网络架构,减少自由参数并提升归纳偏置。
  • 提出一种模块化架构,其中不同组件(q1, q2, q3–q5)可独立设置为等变、指示性或常规模式,实现对部分对称性的灵活设计。
  • 实现并比较多种配置:Equi+Equi+Equi、Equi+Deic+Deic 与 Conv+Conv+Conv 等基线,通过消融实验隔离性能增益。
  • 将方法应用于密集像素-动作空间学习,采用全卷积网络(FCN),在状态头和动作头中均引入等变性,扩展标准方法。
  • 将数据增强(如随机旋转、平移)和对比学习作为对比基线,同时强调本方法将对称性硬编码于网络架构中。

实验结果

研究问题

  • RQ1在视觉状态和空间动作空间中,最优 Q 函数在 SE(2) 变换下保持等变性的条件是什么?
  • RQ2如何设计神经网络架构,以在机器人操作的 Q-learning 中强制实现 SE(2) 等变性?
  • RQ3当仅部分状态变量具有对称性时,部分等变性对策略学习性能有何影响?
  • RQ4与非等变和数据增强基线相比,等变 Q-learning 在样本效率和最终性能方面表现如何?
  • RQ5等变 Q-learning 是否能有效从仿真泛化到真实世界机器人控制任务?

主要发现

  • 当环境动力学和奖励在视觉状态空间的旋转和平移下保持不变时,最优 Q 函数具有 SE(2) 等变性。
  • 等变 Q-网络在样本效率方面显著优于标准非等变模型,在所有测试任务中均以更少的环境交互次数实现更高的成功率。
  • 在积木搭建和箱子打包任务中,Equi+Equi+Equi 架构在仿真中达到 100% 成功率,显著优于 Conv+Conv+Conv 基线。
  • 在真实世界的瓶子排列和纸箱堆垛任务中,q3–q5 采用指示性编码的等变模型分别实现了 90% 和 85% 的成功率,展现出强大的仿真到现实迁移能力。
  • 等变推理的运行时开销更高(等变 FCN 每步 0.72 秒,常规 FCN 每步 0.08 秒),但样本效率的提升使其开销具有合理性。
  • 消融实验表明,将常规层替换为等变或指示性组件可提升性能,最佳结果出现在 q1 和 q2 均为等变、q3–q5 采用指示性编码时。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。