Skip to main content
QUICK REVIEW

[논문 리뷰] Unsupervised Visual Attention and Invariance for Reinforcement Learning

Xudong Wang, Long Lian|arXiv (Cornell University)|2021. 04. 07.
Reinforcement Learning in Robotics참고 문헌 62인용 수 4
한 줄 요약

이 논문은 시각적 관찰에서 배경 잡음과 과도한 정보를 제거하고 작업에 관련된 특징을 강조함으로써 가시적 관찰을 적응시키는 비지도 학습 방법인 시각적 주의 및 불변성(Visual Attention and Invariance, VAI)을 제안한다. VAI는 딥마인드 컨트롤 및 드로워월드 벤치마크에서 기존 방법보다 평균 누적 보상이 15% 높고, 추론 시 2배 이상 빠르며 GPU 메모리 사용량도 40% 줄여 최신 기술(SOTA) 수준의 성능을 달성한다.

ABSTRACT

Vision-based reinforcement learning (RL) is successful, but how to generalize it to unknown test environments remains challenging. Existing methods focus on training an RL policy that is universal to changing visual domains, whereas we focus on extracting visual foreground that is universal, feeding clean invariant vision to the RL policy learner. Our method is completely unsupervised, without manual annotations or access to environment internals. Given videos of actions in a training environment, we learn how to extract foregrounds with unsupervised keypoint detection, followed by unsupervised visual attention to automatically generate a foreground mask per video frame. We can then introduce artificial distractors and train a model to reconstruct the clean foreground mask from noisy observations. Only this learned model is needed during test to provide distraction-free visual input to the RL policy learner. Our Visual Attention and Invariance (VAI) method significantly outperforms the state-of-the-art on visual domain generalization, gaining 15 to 49% (61 to 229%) more cumulative rewards per episode on DeepMind Control (our DrawerWorld Manipulation) benchmarks. Our results demonstrate that it is not only possible to learn domain-invariant vision without any supervision, but freeing RL from visual distractions also makes the policy more focused and thus far better.

연구 동기 및 목표

  • 작업에 특화된 감독 없이도 시각적 관찰에서 간섭 요소에 대한 강화학습 에이전트의 내성 강화를 향상시키기 위해.
  • 테스트 시 인코더를 통해 역전파를 수행하지 않음으로써 추론 시 계산 및 메모리 비용을 줄이기 위해.
  • 원시 관찰을 처리하는 경량 어댑터 모듈을 사용해 새로운 환경에 효율적이고 확장 가능한 적응을 가능하게 하기 위해.
  • 실제 배포 환경에서의 시각적 적응을 위한 가시적이고 디버깅 가능한 방법을 제공하기 위해.
  • 다양한 배경과 간섭 요소를 가진 환경 전반에서 강력한 일반화 성능을 달성하기 위해, 드로워월드와 같은 실제 세계 유사 환경도 포함한다.

제안 방법

  • 이 방법은 원시 픽셀 관찰을 더 불변성 있고 주의 집중된 표현으로 변환하는 학습 가능한 어댑터 모듈을 사용하며, 배경 잡음은 제거하고 작업에 관련된 특징은 강조한다.
  • 어댑터는 이미지 패치에 대해 대비 학습(contrastive learning)을 사용해 비지도 방식으로 학습되며, 정체성을 유지하면서 불필요한 배경 변화는 제거하도록 유도한다.
  • 어댑터는 잠재 특징 공간이 아닌 관찰 공간에서 작동하므로, 적응된 입력의 직접적인 시각적 해석과 디버깅이 가능하다.
  • RL 에이전트는 표준 강화학습 알고리즘(SAC 등)을 사용해 어댑터와 함께 엔드 투 엔드로 훈련되며, 어댑터 파라미터는 훈련 시 역전파로 업데이트되지만 추론 시 동결된다.
  • 이 방법은 지도된 관점점(annotation)이나 외부 데이터셋이 필요 없으며, 오직 이미지 패치에 대한 자기지도 대비 학습에 의존한다.
  • 평가 시 다양한 테스트 환경에 대해 고정된 어댑터를 사용하며, 배포 데이터에 대한 미세조정이나 재학습이 없어 일반화 능력과 낮은 배포 비용을 보장한다.

실험 결과

연구 질문

  • RQ1작업에 특화된 애너테이션 없이도 비지도 시각적 적응 방법이 간섭 요소가 많은 시각적 환경에서 강화학습 에이전트의 성능을 향상시킬 수 있는가?
  • RQ2제안된 어댑터 기반 방법은 특징 공간 적응 방법(PAD 등)과 비교해 추론 속도와 메모리 효율성 측면에서 어떻게 다른가?
  • RQ3어댑터는 다양한 질감, 조명, 간섭 요소 구성이 다른 새로운 환경에 얼마나 잘 일반화되는가?
  • RQ4어댑터 출력의 시각적 점검이 배포 준비성에 대한 신뢰할 수 있는 인간 해석 가능한 진단을 제공할 수 있는가?
  • RQ5비지도 적응을 통해 배경 잡음을 제거하면 간섭 요소가 존재하는 상황에서 보다 안정적이고 강력한 정책 학습이 가능한가?

주요 결과

  • VAI는 딥마인드 컨트롤의 간섭 요소가 많은 환경에서 이전 SOTA(PAD)보다 평균 누적 보상이 15% 높으며, 평균 수익은 806으로 PAD의 698을 상회한다.
  • 컵 안의 공을 잡는 태스크에서 VAI는 956±4의 누적 보상 획득하여 PAD의 545±173보다 420점 높고, 상대적 성능 향상은 77%이다.
  • VAI는 평가 시 PAD보다 2배 이상 빠르며 GPU 메모리 사용량도 40% 줄여, 테스트 시 인코더를 통한 역전파를 피하기 때문이다.
  • 이 방법은 새로운 환경으로의 일반화 능력이 뛰어나며, 배경 변화가 심해도 훈련 분포 수준에 근접한 성능 유지한다.
  • 시각화 결과 어댑터가 배경 잡음을 효과적으로 억제하고 전경의 작업 관련 구조를 강조하는 것으로 확인되었지만, 고반사 표면(예: 마라블)이 있는 경우 모델이 혼동하는 경우가 있다.
  • 어댑터의 출력은 가시적으로 해석 가능하므로, 정책 롤아웃이나 보상 함수 없이도 배포 적합성에 대한 신속한 평가가 가능하다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.