Skip to main content
QUICK REVIEW

[논문 리뷰] SECANT: Self-Expert Cloning for Zero-Shot Generalization of Visual Policies

Linxi Fan, Guanzhi Wang|arXiv (Cornell University)|2021. 06. 17.
Multimodal Machine Learning Applications참고 문헌 70인용 수 14
한 줄 요약

Secant는 약한 증강을 사용해 강화학습을 통해 정책을 훈련한 후, 강한 증강을 사용해 학습된 학생 네트워크로 정책을 흡수하는 이중 단계의 자기 전문가 클로닝 프레임워크를 제안한다. 이 방식은 네 가지 시각적 강화학습 도메인에서 최신 기준(SOTA) 수준의 제로샷 일반화 성능을 달성하며, 평균 보상 향상률은 각각 DMControl에서 26.5%, 로봇 조작에서 337.8%, 자율 주행에서 47.7%, 실내 내비게이션에서 15.8%이다.

ABSTRACT

Generalization has been a long-standing challenge for reinforcement learning (RL). Visual RL, in particular, can be easily distracted by irrelevant factors in high-dimensional observation space. In this work, we consider robust policy learning which targets zero-shot generalization to unseen visual environments with large distributional shift. We propose SECANT, a novel self-expert cloning technique that leverages image augmentation in two stages to decouple robust representation learning from policy optimization. Specifically, an expert policy is first trained by RL from scratch with weak augmentations. A student network then learns to mimic the expert policy by supervised learning with strong augmentations, making its representation more robust against visual variations compared to the expert. Extensive experiments demonstrate that SECANT significantly advances the state of the art in zero-shot generalization across 4 challenging domains. Our average reward improvements over prior SOTAs are: DeepMind Control (+26.5%), robotic manipulation (+337.8%), vision-based autonomous driving (+47.7%), and indoor object navigation (+15.8%). Code release and video are available at https://linxifan.github.io/secant-site/.

연구 동기 및 목표

  • 큰 시각 분포 이동 상황에서 시각적 강화학습의 제로샷 일반화 문제를 해결한다.
  • 강화학습에서 표현의 강건성과 훈련 안정성 간의 상충 관계를 해소하기 위해 정책 최적화와 표현 강건성 학습을 분리한다.
  • 테스트 시 적응 또는 보상 신호 없이도 새로운 시각 환경으로 일반화할 수 있는 방법을 개발한다.
  • 로봇공학, 자율 주행, 내비게이션 등 다양한 실제 시각 도메인에서 뛰어난 성능을 입증한다.

제안 방법

  • 원래 환경에서 약한 증강(예: 무작위 컷팅)만을 사용해 강화학습을 통해 전문가 정책을 훈련한다.
  • 입력 관측치에 강한 증강(예: Cutout, Mixup, Cutmix, 가우시안 노이즈)을 적용한 후, 지도학습을 통해 학생 네트워크가 전문가의 행동을 모방하도록 훈련한다.
  • 첫 번째 단계에서 강화학습을 통해 정책 학습을 수행하고, 두 번째 단계에서 지도학습을 통해 정책 최적화와 표현 강건성 학습을 분리한다.
  • 학생 훈련 중에 동일한 전문가 정책이 참값 행동을 제공함으로써, 시각적 손상이 발생하더라도 정책 성능이 유지됨을 보장한다.
  • 학생 훈련 중 강한 증강을 적용해 불필요한 시각적 변형에 대해 불변성을 유도함으로써 제로샷 일반화 성능을 향상시킨다.
  • 전문가나 학생이 훈련 중에 테스트 환경을 접촉하지 않도록 하며, 테스트 시 적응을 피함으로써 방법이 엄격히 제로샷임을 확보한다.

실험 결과

연구 질문

  • RQ1정책 최적화와 표현 강건성 학습을 분리하는 이중 단계 접근 방식이 시각적 강화학습에서 제로샷 일반화를 향상시키는가?
  • RQ2Cutmix와 Mixup와 같은 강한 데이터 증강이 강화학습 훈련이 아닌 모방 학습 시 적용되었을 때 얼마나 효과적인가?
  • RQ3강한 증강을 활용한 자기 전문가 클로닝이 큰 시각 분포 이동이 있는 도메인에서 이전 최신 기준(SOTA) 방법을 얼마나 뛰어나게 하는가?
  • RQ4사이클 일致성과 시각적 중요도 맵을 측정했을 때, 제안된 방법이 기준 모델보다 더 과제에 관련되고 강건한 시각 표현을 학습하는가?
  • RQ5PAD와 같이 기울기 기반 테스트 시 적응이 필요한 방법과 비교해 Secant의 추론 속도는 어떠한가?

주요 결과

  • 제로샷 일반화 조건에서 DeepMind Control Suite에서 이전 최신 기준(SOTA) 대비 평균 보상 향상률 26.5%를 달성한다.
  • 로봇 조작 작업에서 Secant는 이전 최신 기준 방법 대비 성능을 337.8% 향상시킨다.
  • CARLA에서의 시각 기반 자율 주행 환경에서, Secant는 다양한 날씨와 조명 조건에서도 이전 최신 기준 대비 평균 주행 거리 47.7% 향상시킨다.
  • iGibson의 실내 내비게이션 환경에서, Secant는 새로운 텍스처와 레이아웃를 가진 새로운 방에서 이전 방법 대비 성공률 15.8% 향상시킨다.
  • CPU 기준 PAD 대비 65배, GPU 기준 42배 빠른 추론 속도를 기록함으로써, 기울기 기반 테스트 시 적응이 필요한 방법보다 효율적이다.
  • 시각적 중요도 맵과 사이클 일치성 분석 결과, Secant가 기준 모델보다 더 강건하고 과제에 관련된 시각 표현을 학습함을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.