Skip to main content
QUICK REVIEW

[논문 리뷰] Generalization in Reinforcement Learning by Soft Data Augmentation

Nicklas Hansen, Xiaolong Wang|arXiv (Cornell University)|2020. 11. 26.
Reinforcement Learning in Robotics참고 문헌 43인용 수 16
한 줄 요약

이 논문은 시각 기반 강화학습을 위한 소프트 데이터 증강 방법인 SODA를 제안한다. SODA는 표현 학습을 정책 최적화에서 분리한다. 증강된 관측치와 원본 관측치 간의 상호정보량을 최대화하도록 공유 인코더를 훈련시키며, 동시에 정책은 증강되지 않은 데이터에서 훈련된다. 이를 통해 SODA는 샘플 효율성, 일반화 능력 및 훈련 안정성을 향상시킨다. 이는 10개의 DMControl-GB 과제 중 9개에서 최신 기술 수준을 달성하고, 모든 로봇 조작 테스트 환경에서도 최고 성능을 기록한다.

ABSTRACT

Extensive efforts have been made to improve the generalization ability of Reinforcement Learning (RL) methods via domain randomization and data augmentation. However, as more factors of variation are introduced during training, optimization becomes increasingly challenging, and empirically may result in lower sample efficiency and unstable training. Instead of learning policies directly from augmented data, we propose SOft Data Augmentation (SODA), a method that decouples augmentation from policy learning. Specifically, SODA imposes a soft constraint on the encoder that aims to maximize the mutual information between latent representations of augmented and non-augmented data, while the RL optimization process uses strictly non-augmented data. Empirical evaluations are performed on diverse tasks from DeepMind Control suite as well as a robotic manipulation task, and we find SODA to significantly advance sample efficiency, generalization, and stability in training over state-of-the-art vision-based RL methods.

연구 동기 및 목표

  • 시각 기반 강화학습에서 증강 데이터를 직접 정책 훈련에 사용할 경우 발생하는 불안정성과 샘플 효율성 저하 문제를 해결하기 위해.
  • 훈련 중에 사용하지 않은 다양한 시각적 환경에 일반화할 수 있도록 하되, 훈련 안정성을 해치지 않기 위해.
  • 강력한 데이터 증강을 표현 학습에 활용하면서도 RL 최적화에 간섭을 최소화하는 방법을 개발하기 위해.
  • 시각 기반 강화학습에서 일반화 평가를 위한 새로운 벤치마크를 설정하기 위해.
  • 증강 처리를 정책 학습에서 분리함으로써 최신 기술 수준의 방법보다 뛰어난 성능을 달성할 수 있음을 입증하기 위해.

제안 방법

  • SODA는 증강된 관측치와 증강되지 않은 관측치를 모두 동일한 잠재 공간으로 매핑하기 위해 공유 인코더를 사용한다.
  • 잠재 표현 간의 상호정보량 최대화를 통해 소프트 제약 조건을 도입한다.
  • 정책 학습은 증강되지 않은 데이터에서만 수행되어 최적화 안정성이 유지된다.
  • 표현 학습 안정화를 위해 증강되지 않은 관측치에 대해 모멘텀 업데이트된 타겟 네트워크를 사용한다.
  • 데이터 증강은 정책 훈련 동안이 아니라 보조 표현 학습 작업 동안에만 적용된다.
  • 이 방법은 자기지도 학습이며, 대조적 방법(예: CURL)과 달리 음성 샘플이 필요하지 않다.

실험 결과

연구 질문

  • RQ1데이터 증강을 사용할 경우 정책 훈련이 불안정해지지 않으면서도 시각 기반 강화학습의 일반화 능력을 향상시킬 수 있는가?
  • RQ2데이터 증강을 정책 학습에서 분리하면 더 높은 샘플 효율성과 안정성 확보가 가능한가?
  • RQ3증강된 관측치와 원본 관측치 간의 상호정보량 최대화가 표현의 불변성 향상에 기여하는가?
  • RQ4SODA는 최신 기술 수준의 방법과 비교해 다양한 시각적으로 도전적인 테스트 환경에서 어떻게 성능을 내는가?
  • RQ5랜덤화된 카메라, 조명, 텍스처 조건을 가진 실제 환경 적용 조건에서도 SODA는 효과적으로 일반화할 수 있는가?

주요 결과

  • SODA는 DMControl 일반화 벤치마크의 10개 환경 중 9개에서 최신 기술 수준의 방법을 능가하며, 특히 영상 배경 테스트 조건 하에서 ball_in_cup_catch 과제에서 최대 81% 향상된 성능 기록.
  • 로봇 조작 과제에서는 훈련 환경에서 평균 수익이 21.3, 랜덤 색상 테스트 환경에서 18.0을 기록하여 기준 모델들을 크게 앞서며 성능 향상을 입증.
  • SODA는 훈련 분산을 줄이고 샘플 효율성을 향상시켜, DMControl 및 로봇 조작 과제에서 둘 다 매끄러운 훈련 및 일반화 곡선을 보여줌.
  • 랜덤 색상 환경과 영상 배경 환경 모두에 대해 잘 일반화되며, 테스트 시점 분포와 다를 수 있는 증강 유형(예: 오버레이 대비 컨볼루션)에도 불구하고 성능 유지.
  • 오버레이 증강을 사용할 경우 랜덤 컨볼루션보다 더 우수한 일반화 성능 기록 → 더 rich한 증강 방식이 표현 불변성 학습에 유리함.
  • 로봇 조작 과제에서 랜덤 카메라, 조명, 텍스처 조건을 포함한 모든 테스트 분포에서 SODA는 뛰어난 성능 기록 → 실제 환경 적용 잠재력 높음.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.