Skip to main content
QUICK REVIEW

[논문 리뷰] $\mathrm{SO}(2)$-Equivariant Reinforcement Learning

Dian Wang, Robin Walters|arXiv (Cornell University)|2022. 03. 08.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 회전 대칭성을 가진 로봇 조작 작업을 위한 SO(2)-등변 깊이 강화 학습 알고리즘—Equivariant DQN과 Equivariant SAC—을 제안한다. 신경망 아키텍처를 SO(2) 회전 대칭성을 내재적으로 유지하도록 설계함으로써, 데이터 증강 기반의 베이스라인에 비해 상당히 높은 샘플 효율성을 달성하며, 단일 방향으로 훈련된 경우에도 객체의 방향에 관계없이 일반화되는 정책을 학습한다.

ABSTRACT

Equivariant neural networks enforce symmetry within the structure of their convolutional layers, resulting in a substantial improvement in sample efficiency when learning an equivariant or invariant function. Such models are applicable to robotic manipulation learning which can often be formulated as a rotationally symmetric problem. This paper studies equivariant model architectures in the context of $Q$-learning and actor-critic reinforcement learning. We identify equivariant and invariant characteristics of the optimal $Q$-function and the optimal policy and propose equivariant DQN and SAC algorithms that leverage this structure. We present experiments that demonstrate that our equivariant versions of DQN and SAC can be significantly more sample efficient than competing algorithms on an important class of robotic manipulation problems.

연구 동기 및 목표

  • 환경의 회전 대칭성을 활용하여 로봇 강화 학습의 샘플 효율성을 향상시키는 것.
  • 전이 및 보상 함수가 SO(2) 회전에 대해 불변인 군 불변 MDP 클래스를 수학적으로 정의하는 것.
  • SO(2) 회전에 대해 본질적으로 등변인 신경망 아키텍처를 설계하여 데이터 증강을 통한 근사가 아닌 정확한 대칭성을 보장하는 것.
  • 등변 모델이 표준 또는 증강된 베이스라인에 비해 객체의 방향에 걸쳐 더 잘 일반화됨을 보여주는 것.
  • 등변 학습을 연속 제어(SAC) 및 암시적 학습(LfD)으로 확장하여 광범위한 적용 가능성을 입증하는 것.

제안 방법

  • Q-네트워크와 정책 네트워크에 SO(2)-등변 컨볼루션 레이어를 도입하여 특징 표현에 대한 회전 등변성을 강제한다.
  • SO(2)-불변 상태 표현을 사용하여 이산 행동 공간에서 등변성을 유지하는 새로운 유형의 Equivariant DQN을 제안한다.
  • SAC 알고리즘을 수정하여 SO(2)-등변 크리틱과 정책을 사용함으로써 연속 제어에서 대칭성을 유지한다.
  • 동일한 등변 아키텍처를 암시적 학습(LfD)에 적용하여 더 적은 수의 시범으로부터 일반화할 수 있도록 한다.
  • 전이를 증강하기 위해 SO(2) 데이터 증강을 사용하는 버퍼를 활용하지만, 등변 모델이 동일한 증강을 사용하는 베이스라인보다도 뛰어난 성능을 보임을 보여준다.
  • 정확한 평가를 위해 상태-행동 쌍 간의 유사도를 최대화하는 대비 학습 손실을 베이스라인 비교에 도입한다.

실험 결과

연구 질문

  • RQ1SO(2)-등변 신경망 아키텍처는 회전 대칭성을 가진 로봇 조작 작업에서 샘플 효율성을 향상시킬 수 있는가?
  • RQ2단일 객체 방향으로 훈련된 등변 모델이 무작위로 설정된 방향의 테스트 환경으로 일반화되는 정도는 어떠한가?
  • RQ3아키텍처 수준의 등변성 강제가 등변성을 근사하는 데이터 증강 기법보다 성능이 뛰어나게 되는가?
  • RQ4등변 깊이 강화 학습은 연속 제어(SAC) 및 암시적 학습(LfD)으로 성공적으로 확장될 수 있는가?
  • RQ5RAD와 DrQ와 같은 최신 데이터 증강 기반 베이스라인과 비교했을 때, SO(2) 증강을 사용하는 등변 모델과의 성능 격차는 어떠한가?

주요 결과

  • Equivariant SACfD는 모든 네 가지 로봇 조작 작업에서 RAD 및 DrQ와 같은 SO(2) 데이터 증강을 사용하는 모든 베이스라인을 능가하며, 특히 가장 도전적인 작업에서 가장 큰 성과 향상을 보였다.
  • 오직 등변 모델만이 객체 방향에 걸쳐 일반화가 필요한 코너 집게 및 하우스 빌딩 작업을 성공적으로 해결했다.
  • 일반화 실험에서, 등변 모델은 단일 고정된 방향으로 훈련된 경우에도 SO(2) 회전에 대해 효과적으로 일반화되었지만, 모든 베이스라인이 실패했다.
  • 등변 모델은 훨씬 적은 환경 상호작용 횟수로도 뛰어난 성능를 달성하여, 데이터 증강 기반 베이스라인보다 높은 샘플 효율성을 입증했다.
  • 제안된 Equivariant SAC 및 DQN 변종은 블록 끌기, 서랍 열기, 블록 쌓기, 하우스 빌딩 등 다양한 환경에서 일관된 향상을 보였다.
  • 결과적으로, 데이터 증강을 통한 등변성 학습보다 아키텍처에 내재된 인덕티브 바이어스를 통한 등변성 설계가 더 효과적임을 시사한다. 이는 둘 다 동일한 증강 전략을 사용할 때에도 마찬가지로 성립한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.