[논문 리뷰] RRL: Resnet as representation for Reinforcement Learning
RRL은 전훈련된 ResNet 특징을 강화학습에서 시각적 표현으로 사용하여, 카메라 및 관절 센서와 같은 체내 감각 입력에서 직접 샘플 효율적인 정책 학습을 가능하게 한다. ImageNet에서 전훈련된 ResNet-34 인코더를 고정함으로써 RRL은 전체 상태 정보를 사용하는 최첨단 방법과 유사한 성능을 달성하며, 특히 Adroit Manipulation과 같은 복잡하고 접촉이 많은 조작 작업에서 뛰어난 성능을 보인다.
The ability to autonomously learn behaviors via direct interactions in uninstrumented environments can lead to generalist robots capable of enhancing productivity or providing care in unstructured settings like homes. Such uninstrumented settings warrant operations only using the robot's proprioceptive sensor such as onboard cameras, joint encoders, etc which can be challenging for policy learning owing to the high dimensionality and partial observability issues. We propose RRL: Resnet as representation for Reinforcement Learning -- a straightforward yet effective approach that can learn complex behaviors directly from proprioceptive inputs. RRL fuses features extracted from pre-trained Resnet into the standard reinforcement learning pipeline and delivers results comparable to learning directly from the state. In a simulated dexterous manipulation benchmark, where the state of the art methods fail to make significant progress, RRL delivers contact rich behaviors. The appeal of RRL lies in its simplicity in bringing together progress from the fields of Representation Learning, Imitation Learning, and Reinforcement Learning. Its effectiveness in learning behaviors directly from visual inputs with performance and sample efficiency matching learning directly from the state, even in complex high dimensional domains, is far from obvious.
연구 동기 및 목표
- 카메라 및 관절 인코더와 같은 체내 감각 센서만을 사용하여 비구조적이고 실제 세계 환경에서 복잡한 행동을 학습하는 도전에 대응한다.
- 샘플 효율적인 강화학습을 방해하는 고차원적이고 부분 관측 가능한 시각 입력 문제를 해결한다.
- 작업 특화 또는 환경 장비를 통한 상태 표현에 대한 의존도를 줄이기 위해 일반적인 목적의 전훈련된 시각적 특징을 활용한다.
- 고정된 전훈련된 ResNet 특징이 복잡하고 고차원적인 제어 작업에서 상태 기반 강화학습과 동등한 성능을 낼 수 있음을 입증한다.
제안 방법
- ImageNet에서 전훈련된 ResNet-34 모델을 사용하여 원시 RGB 관측값에서 특징을 추출하는 고정된 시각 인코더로 활용한다.
- 표현 학습과 정책 학습을 동시에 최적화하는 것과 같은 비정적성을 피하기 위해, 전훈련된 ResNet 특징을 표준 온정책 강화학습 알고리즘(DAPG 등)에 직접 통합한다.
- ImageNet에 포함된 실제 세계 이미지의 광범위한 분포를 활용하여 정책 학습 중에 발생할 수 있는 다양한 실제 세계 시각 분포에 일반화될 수 있도록 표현을 보장한다.
- 표현과 정책을 동시에 최적화하는 것에서 발생하는 비정적성을 방지함으로써 안정적인 학습 과정을 유지한다.
- 다양한 작업에 대해 재학습 없이 동일한 전훈련된 인코더를 사용함으로써, 유사한 시각적 특성을 가진 새로운 작업에 대해 제로샷 전이를 가능하게 한다.
- 상태 정보 없이 시각적 관측값만을 사용하고, 작업 특화의 데이터 증강 또는 표현 전훈련을 피한다.
실험 결과
연구 질문
- RQ1전훈련된 ResNet 특징는 실제 세계 로봇 제어에서 엔드 투 엔드 강화학습에 효과적이고 일반적인 목적의 시각적 표현으로서 기능할 수 있는가?
- RQ2고정된 전훈련된 인코더를 사용할 경우, 표현과 정책를 동시에 학습하는 것과 비교해 샘플 효율성과 학습 안정성이 향상되는가?
- RQ3최첨단 방법이 큰 진전을 이룰 수 없는 복잡하고 접촉이 많은 조작 작업에서 RRL의 성능는 어떠한가?
- RQ4ImageNet에서 학습된 표현은 다양한 시각 분포를 가진 작업 간에 얼마나 일반화되는가? 특히 작업 특화 표현과 비교했을 때 어떻게 되는가?
- RQ5단일 고정된 표현을 사용하여 추가 전훈련 없이도 다양한 고차원적 로봇 제어 작업 간에 효과적인 전이가 가능한가?
주요 결과
- RRL은 Adroit Manipulation 벤치마크에서 전체 상태 정보를 사용하는 최첨단 방법과 유사한 성능을 달성하였으며, 이는 복잡하고 접촉이 많은 민감한 조작 작업 세트이다.
- DMControl 벤치마크에서는 100K 및 500K 환경 스텝에서 RAD 및 SAC+AE와 같은 작업 특화 방법에 비해 성능가 낮게 나타나, 단순하고 저복잡한 환경에서는 작업 특화 표현이 더 샘플 효율적임을 시사한다.
- 작업 특화 표현(예: CartPole에서 전훈련된 RAD 인코더)의 성능는 다른 DMControl 환경에서는 뚜렷하게 떨어지며, 작업 간 일반화 능력이 떨어짐을 보여준다.
- RRL에서 고정된 전훈련된 ResNet-34 인코더를 사용함으로써 더 안정적인 학습이 가능하고, 표현과 정책를 동시에 학습할 때 흔히 발생하는 비정적성 문제를 피할 수 있다.
- 그림 5에서 보듯이, 표현 헤드를 처음부터 학습시킬 필요가 없어져 샘플 및 계산 자원 절약에 기여한다.
- 결과는 시뮬레이션 벤치마크인 DMControl과 실제 세계 로봇 작업 사이에 큰 도메인 갭이 있음을 시사하며, 향후 강화학습 연구에서 더 현실적인 벤치마크가 필요하다고 강조한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.