Skip to main content
QUICK REVIEW

[논문 리뷰] Zero-Shot Reinforcement Learning with Deep Attention Convolutional Neural Networks

Şahika Genç, Sunil Mallya|arXiv (Cornell University)|2020. 01. 02.
Domain Adaptation and Few-Shot Learning참고 문헌 32인용 수 7
한 줄 요약

이 논문은 주의 메커니즘을 통해 인식과 제어를 동시에 최적화함으로써, 훈련 없이도 실세계 미세조정 없이도 제로샷 강화학습을 가능하게 하는 딥 어텐션 컨volution 신경망(DACNN)을 제안한다. 이는 도메인 랜덤화 기반의 기준 모델과 유사한 성능을 낼 뿐 아니라 계산 비용을 크게 낮춘다. 모델은 사전 훈련 없이도 작업에 관련된 시각적 특징에 집중할 수 있으며, 자율주행 작업에서 시뮬레이션에서 실제 환경으로의 전이에 대해 뛰어난 강건성을 보인다.

ABSTRACT

Simulation-to-simulation and simulation-to-real world transfer of neural network models have been a difficult problem. To close the reality gap, prior methods to simulation-to-real world transfer focused on domain adaptation, decoupling perception and dynamics and solving each problem separately, and randomization of agent parameters and environment conditions to expose the learning agent to a variety of conditions. While these methods provide acceptable performance, the computational complexity required to capture a large variation of parameters for comprehensive scenarios on a given task such as autonomous driving or robotic manipulation is high. Our key contribution is to theoretically prove and empirically demonstrate that a deep attention convolutional neural network (DACNN) with specific visual sensor configuration performs as well as training on a dataset with high domain and parameter variation at lower computational complexity. Specifically, the attention network weights are learned through policy optimization to focus on local dependencies that lead to optimal actions, and does not require tuning in real-world for generalization. Our new architecture adapts perception with respect to the control objective, resulting in zero-shot learning without pre-training a perception network. To measure the impact of our new deep network architecture on domain adaptation, we consider autonomous driving as a use case. We perform an extensive set of experiments in simulation-to-simulation and simulation-to-real scenarios to compare our approach to several baselines including the current state-of-art models.

연구 동기 및 목표

  • 실세계 미세조정 없이도 시뮬레이션에서 실제 환경으로의 도메인 갭 문제를 해결하기 위해 강화학습을 위한 로봇 공학에 도전한다.
  • 기반 시뮬레이션 훈련에서 도메인 및 파라미터 랜덤화의 높은 계산 비용을 해결한다.
  • 제어 목표에 부합하는 주의 기반 특징 가중치 학습을 통해 인식과 제어를 통합한다.
  • 오직 시뮬레이션 데이터만을 사용하여 자율주행과 같은 시각 기반 제어 작업에서 제로샷 일반화를 가능하게 한다.
  • 컨volution 신경망에서의 주의 메커니즘이 명시적인 동역학 모델링 없이도 안정적 제어를 위한 피아스티비 유사 시스템 성질을 포착할 수 있음을 보여준다.

제안 방법

  • 원시 이미지 관측을 여러 컨volution 레이어를 거쳐 처리한 후 주의 메커니즘을 적용하는 딥 어텐션 컨volution 신경망(DACNN)을 도입한다.
  • 사전 훈련된 CNN에서 추출한 애너테이션 벡터를 이미지 특징으로 정의함으로써, 주의 네트워크가 관련된 시각적 구성 요소에 집중할 수 있도록 한다.
  • 정책 최적화를 통해 주의 네트워크가 전체 이미지 오차를 최소화하는 데 기여하는 국소적 이미지 특징을 가중치로 설정하도록 훈련함으로써, 인식과 제어 목표를 직접 연결한다.
  • 구면 카메라 기하학과 고정된 방향의 애너테이션 벡터를 활용하여 동적 시스템 내에서 피아스티비 유사 성질을 유지함으로써 안정성을 확보한다.
  • 자율주행 시뮬레이션에서 차선 중심 유지와 고속 주행을 장려하는 보상 함수를 사용하여, 프록시 정책 최적화(PPO)를 통해 전체 DACNN을 엔드 투 엔드로 훈련한다.
  • 별도의 인식 및 제어 모듈을 피하고, 제어 목표에 적응하는 주의 기반 특징 선택을 통해 둘을 함께 최적화한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 주의 기반 컨volution 신경망 아키텍처가 도메인 랜덤화 기반 기준 모델과 유사한 제로샷 강화학습 성능을 달성하면서도 계산 비용을 크게 낮출 수 있는가?
  • RQ2컨볼루션 신경망 기반 정책 네트워크에서 주의 기반 특징 가중치가 실세계 미세조정 없이도 조명, 질감 등의 도메인 이동에 대해 일반화 성능을 향상시키는가?
  • RQ3시각 기반 제어 정책에서 주의 메커니즘이 다양한 시각 조건 하에서도 피아스티비 유사 시스템 성질을 유지하여 안정적 제어를 보장할 수 있는가?
  • RQ4DACNN 아키텍처는 시뮬레이션-시뮬레이션 및 시뮬레이션-실세계 시나리오에서 훈련 수렴 속도와 샘플 효율성 측면에서 DARLA와 같은 다단계 에이전트와 비교해 어떻게 성능을 내는가?
  • RQ5주의 유닛의 선택과 배치 크기의 조합이 DACNN 프레임워크 내에서 학습 속도와 최종 성능에 얼마나 큰 영향을 미치는가?

주요 결과

  • DACNN는 인식 훈련 단계 없이도 최첨단 다단계 에이전트인 DARLA와 유사한 훈련 수렴 속도를 달성한다.
  • 배치 크기를 64로 설정할 경우 32로 설정할 때보다 수렴 속도가 빠르며, 주의 유닛 수를 64에서 256으로 늘일수록 학습 속도와 안정성이 더욱 향상된다.
  • DACNN 모델은 실세계 미세조정 없이도 시뮬레이션-시뮬레이션 및 시뮬레이션-실세계 전이 작업에서 높은 성능을 유지하여 진정한 제로샷 일반화를 입증한다.
  • 주의 메커니즘이 간섭 요소(예: 차선 이탈 물체)를 효과적으로 걸러내고, 차선 경계와 같은 관련 시각적 단서에 집중하는 것으로 시각적 비교를 통해 확인되었다.
  • 기본 컨볼루션 신경망의 불변성 성질과 주의 기반 특징 선택 덕분에 질감 및 조도 변화에 대해 강건한 성능을 유지한다.
  • 특히 넓은 도메인 일반화가 요구되는 상황에서 샘플 효율성과 계산 비용 측면에서 기준 모델보다 DACNN이 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.