Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating Vision Transformer Methods for Deep Reinforcement Learning from Pixels

Tianxin Tao, Daniele Reda|arXiv (Cornell University)|2022. 04. 11.
Advanced Memory and Neural Computing인용 수 4
한 줄 요약

이 논문은 원시 픽셀에서의 강화학습을 위한 시각적 변형기(ViT)를 자기지도 학습 전훈 방법—마스킹 기반, 대비 기반, 예측 기반 목표—을 사용하여 평가한다. ViT가 컴퓨터 비전 분야에서 성공을 거둔 것과는 달리, 본 연구는 보조 작업이 ViT 성능을 향상시킨다는 것을 확인하지만, 최상위 성능를 기록하는 CNN 기반 RAD 방법이 여전히 모든 ViT 변종보다 뛰어나며, 마스킹 기반 전훈(예: MAE)이 대비 학습보다 뚜렷이 뛰어나다는 것을 발견한다.

ABSTRACT

Vision Transformers (ViT) have recently demonstrated the significant potential of transformer architectures for computer vision. To what extent can image-based deep reinforcement learning also benefit from ViT architectures, as compared to standard convolutional neural network (CNN) architectures? To answer this question, we evaluate ViT training methods for image-based reinforcement learning (RL) control tasks and compare these results to a leading convolutional-network architecture method, RAD. For training the ViT encoder, we consider several recently-proposed self-supervised losses that are treated as auxiliary tasks, as well as a baseline with no additional loss terms. We find that the CNN architectures trained using RAD still generally provide superior performance. For the ViT methods, all three types of auxiliary tasks that we consider provide a benefit over plain ViT training. Furthermore, ViT reconstruction-based tasks are found to significantly outperform ViT contrastive-learning.

연구 동기 및 목표

  • 원시 픽셀에서의 강화학습을 위한 시각적 변형기(ViT)가 효과적으로 시각적 표현을 학습할 수 있는지 조사하기 위해.
  • 마스킹, 대비 학습, 미래 예측의 세 가지 자기지도 전훈 목표가 ViT 기반 강화학습 정책에 미치는 영향을 평가하기 위해.
  • 표준 제어 환경에서 ViT 기반 방법과 강력한 CNN 기반 기준인 RAD 간의 성능을 비교하기 위해.
  • 데이터 증강 및 보조 작업이 ViT 기반 강화학습에서 샘플 효율성과 최종 성능을 향상시키는지 여부를 확인하기 위해.
  • 고차원 시각 입력을 가진 후행 강화학습 제어 작업으로의 자기지도 학습된 ViT 전훈의 이식 가능성 평가하기 위해.

제안 방법

  • 마스킹된 오토인코더(MAE), Data2Vec, 동량 대비 학습(MoCo)을 포함한 세 가지 자기지도 학습 ViT 전훈 방법을 적응 적용한다.
  • ViT 인코더를 소프트 액터-크리틱(SAC) 에이전트와 통합하여 정책과 보조 목표를 공유 표현 학습을 통해 공동으로 훈련시킨다.
  • 주로 랜덤 크롭핑을 데이터 증강 전략으로 사용하며, 100×100 관측값을 84×84로 리사이징한다.
  • 4층, 8개의 어텐션 헤드, 12×12 패치 크기, 128차원 잠복 공간을 가진 경량 ViT 아키텍처를 사용한다.
  • 대비 학습을 위한 이중 분지 디코더 헤드와 MAE를 위한 학습 가능한 마스킹 벡터를 사용하며, 대비 목표는 별도 최적화를 수행한다.
  • SAC+AE에서처럼 액터에서 인코더로의 기울기 차단을 구현하여 표현 학습의 안정성을 확보하면서도, 공유 인코더에 대한 크리틱 업데이트를 허용한다.

실험 결과

연구 질문

  • RQ1자기지도 전훈을 적용한 시각적 변형기(ViT)가 이미지 기반 강화학습에서 샘플 효율성과 최종 성능을 효과적으로 향상시킬 수 있는가?
  • RQ2마스킹, 대비 학습, 미래 예측의 세 가지 자기지도 전훈 목표 중 어떤 것이 ViT 정책 학습을 더 잘 이끌 수 있는가?
  • RQ3표준 제어 벤치마크에서 ViT 기반 강화학습 에이전트의 성능이 RAD와 같은 최첨단 CNN 기반 방법을 능가하는가, 아니면 뒤지게 되는가?
  • RQ4특히 랜덤 크롭핑을 통한 데이터 증강이 ViT 훈련의 안정성과 강화학습 환경에서의 성능에 어떤 영향을 미치는가?
  • RQ5ViT 아키텍처를 사용할 경우 표현 학습의 병목 현상을 보완하기 위해 보조 작업을 도입할 수 있는가?

주요 결과

  • CNN 기반 RAD 방법은 평가된 모든 환경에서 모든 ViT 기반 접근 방식을 일관되게 능가하며, 이는 이 설정에서 ViT가 기존의 CNN을 능가하지는 못한다는 것을 시사한다.
  • MAE, Data2Vec, MoCo의 세 가지 보조 전훈 방법 모두 원칙적으로 보조 목표 없이 전훈한 경우보다 ViT 성능을 향상시킨다.
  • 마스킹 기반 전훈(MAE)이 ViT 기반 강화학습에서 대비 학습(MoCo)보다 뚜렷이 뛰어나며, 재구성 작업이 정책 학습에 더 효과적이라는 것을 시사한다.
  • Data2Vec 기반 전훈은 중간 정도의 향상 효과를 보였지만, MAE와 RAD 기준보다 성능이 열 劣하다.
  • 마스킹 비율(40% 및 75%)의 선택이 성능에 영향을 미치며, MAE에서 75% 마스킹이 더 좋은 성능을 내어 더 높은 복원 복잡도가 표현 품질을 향상시킨다는 것을 시사한다.
  • 보조 목표와 함께 공동 훈련하고 액터에서 인코더로의 기울기 차단을 적용함으로써 학습 안정성이 향상되고 최종 수익이 증가하여 아키텍처 및 훈련 설계 선택의 가치를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.