Skip to main content
QUICK REVIEW

[논문 리뷰] Gradient-free Policy Architecture Search and Adaptation

Sayna Ebrahimi, Anna Rohrbach|arXiv (Cornell University)|2017. 10. 16.
Reinforcement Learning in Robotics참고 문헌 21인용 수 12
한 줄 요약

이 논문은 전문가의 지시와 환경 보상 정보를 동시에 활용하여 안전하고 높은 성능을 내는 자율 주행 정책을 학습하기 위해 기울기 기반 정책 아키텍처 탐색 및 적응 방법을 제안한다. 타겟 도메인의 보상 정보만을 사용하여 네트워크 아키텍처를 최적화하고 도메인 전이에 적응함으로써 누적 사고 수를 줄이고 기준 방법에 비해 뛰어난 성능을 달성한다.

ABSTRACT

We develop a method for policy architecture search and adaptation via gradient-free optimization which can learn to perform autonomous driving tasks. By learning from both demonstration and environmental reward we develop a model that can learn with relatively few early catastrophic failures. We first learn an architecture of appropriate complexity to perceive aspects of world state relevant to the expert demonstration, and then mitigate the effect of domain-shift during deployment by adapting a policy demonstrated in a source domain to rewards obtained in a target environment. We show that our approach allows safer learning than baseline methods, offering a reduced cumulative crash metric over the agent's lifetime as it learns to drive in a realistic simulated environment.

연구 동기 및 목표

  • 정책 학습 중에 발생하는 위험한 탐색을 최소화하여 초기 치명적인 실패를 방지하는 데 목적이 있다.
  • 타겟 도메인의 지시 없이도 빛, 날씨 등의 도메인 전이에 대한 정책 일반화를 향상시키는 데 목적이 있다.
  • 전문가 지시와 환경 보상 정보를 동시에 사용하여 정책 아키텍처와 파라미터를 공동 최적화함으로써 더 안전하고 효율적인 학습을 달성하는 데 목적이 있다.
  • 타겟 도메인의 지시나 정렬 정보 없이도 소스 도메인의 정책을 새로운, 시각적으로 다른 환경으로 효과적으로 적응시키는 데 목적이 있다.

제안 방법

  • 기울기 기반 최적화 알고리즘을 기반으로 하되, 더 정확하고 효율적인 기울기 추정을 위해 개선된 노이즈 생성 기법을 통합한 알고리즘.
  • perception 및 제어를 위한 최적의 정책 아키텍처를 찾기 위해 가변 길이의 신경망 아키텍처를 대상으로 유전적 탐색을 수행하는 아키텍처 탐색 방법.
  • 타겟 도메인에서 전문가 지시를 통한 행동 클로닝과 환경 보상 정보를 통한 강화 학습을 동시에 수행하여 정책 네트워크를 훈련시키는 방법.
  • 타겟 도메인에서의 지시나 정렬 정보 없이도 보상 기반 미세조정을 통해 사전 학습된 소스 도메인 정책을 타겟 도메인에 적응시키는 방법.
  • 아키텍처 탐색 과정에서 정확도와 모델 크기 간의 균형을 고려한 복합 보상 함수 사용.
  • GTA5 시뮬레이션 환경에서 엔드 투 엔드 훈련을 수행하여 조향, 브레이킹, 페달 조작 예측 성능 평가.

실험 결과

연구 질문

  • RQ1기울기 기반 아키텍처 탐색이 고정 또는 수작업 설계된 아키텍처에 비해 자율 주행 정책의 성능과 안전성 향상에 기여하는가?
  • RQ2전문가 지시와 환경 보상 정보를 동시에 사용한 공동 학습이 정책 학습 중 사고 수를 얼마나 효과적으로 줄이는가?
  • RQ3한 도메인에서 학습된 정책이 보상 피드백만을 사용하여 새로운, 시각적으로 다를 수 있는 도메인으로 얼마나 효과적으로 적응할 수 있는가?
  • RQ4성능과 컴actness(작은 크기)를 동시에 고려해 정책 아키텍처를 최적화하면 일반화 능력과 안전성 향상에 기여하는가?

주요 결과

  • 제안된 방법은 전문가 지시나 보상 정보에만 의존하는 기준 방법에 비해 학습 과정에서 누적 사고 수가 감소하였다.
  • 적응된 정책는 53시간의 훈련(에피소드 #832) 후 평균 보상 100%를 달성하였고, 열악한 성능을 보인 기준 방법(97.3%)보다 뛰어난 성능을 보였다.
  • 보행자 횡단보도와 같은 복잡한 상황에서, 적응된 모델은 브레이킹(0.956)과 페달 조작(0.052)을 정확히 예측하였고, 행동 클로닝에 기반한 모델은 잘못된 행동으로 계속 주행(브레이킹: 0.191)을 시도하였다.
  • 소스 및 타겟 도메인 보상을 모두 사용해 훈련한 대규모 네트워크는 타겟 도메인에서 테스트 손실 3×10⁻⁵를 기록하였으며, Bojarski 등 [3]의 결과(1.85×10⁻⁴)에 비해 뚜렷이 뛰어난 성능을 보였다.
  • 모든 설정에서 조향 각도 예측 손실이 약 10⁻⁵ 수준으로 거의 완벽한 성능를 보였으며, 이는 이 제어 신호에 대한 강건성을 시사한다.
  • 전문가 지시 분포에서 멀리 떨어져 초기화된 경우에도 효과적인 적응이 가능함을 입증하여 도메인 전이에 대한 강건성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.