Skip to main content
QUICK REVIEW

[논문 리뷰] Learning with Stochastic Guidance for Navigation

Linhai Xie, Yishu Miao|arXiv (Cornell University)|2018. 11. 27.
Reinforcement Learning in Robotics참고 문헌 8인용 수 4
한 줄 요약

이 논문은 복잡한 고차원 주행 환경에서 희박한 보상 환경에서 DDPG를 사용한 강화학습 에이전트가 훈련 중에 고분산 탐색(DDPG를 통해)과 저분산 히우리스틱 제어기(예: PID, 장애물 회피) 사이를 동적으로 전환할 수 있도록 하는 확률적 가이던스 프레임워크를 제안한다. REINFORCE를 사용해 DDPG와 함께 확률적 스위치를 공동으로 훈련시킴으로써, 훈련 분산을 크게 감소시키고 정책 학습을 가속화하며, 최신 기준 대비 뛰어난 주행 성능을 달성한다. 이는 실제 환경으로의 제로샷 전이 성공을 포함한다.

ABSTRACT

Due to the sparse rewards and high degree of environment variation, reinforcement learning approaches such as Deep Deterministic Policy Gradient (DDPG) are plagued by issues of high variance when applied in complex real world environments. We present a new framework for overcoming these issues by incorporating a stochastic switch, allowing an agent to choose between high and low variance policies. The stochastic switch can be jointly trained with the original DDPG in the same framework. In this paper, we demonstrate the power of the framework in a navigation task, where the robot can dynamically choose to learn through exploration, or to use the output of a heuristic controller as guidance. Instead of starting from completely random moves, the navigation capability of a robot can be quickly bootstrapped by several simple independent controllers. The experimental results show that with the aid of stochastic guidance we are able to effectively and efficiently train DDPG navigation policies and achieve significantly better performance than state-of-the-art baselines models.

연구 동기 및 목표

  • 희박한 보상 환경에서 복잡하고 고차원적인 주행 환경에서 DDPG의 높은 분산과 낮은 샘플 효율성 문제를 해결하기 위해.
  • 저분산 히우리스틱 제어기를 동적 가이던스로 통합함으로써 DDPG 정책의 더 빠르고 안정적인 훈련을 가능하게 하기 위해.
  • 히우리스틱 가이던스에 의해 부트스트랩된 후 DDPG 정책이 독립적으로 작동할 수 있도록 하기 위해.
  • 시뮬레이션에서 훈련된 정책을 실제 로봇 주행 작업으로 제로샷 전이할 수 있도록 하기 위해.

제안 방법

  • DDPG 정책 또는 별도의 히우리스틱 제어기(PID 및 장애물 회피)에서 행동을 확률적으로 선택하는 스위치 메커니즘을 도입한다.
  • 스위치는 누적 수익을 최대화하기 위해 REINFORCE 정책 기반 강화 알고리즘을 사용해 훈련되며, 환경 맥락에 따라 제어기 선택이 가능해진다.
  • DDPG 에이전트는 자신의 정책 출력에서가 아니라 확률적 스위치에 의해 선택된 행동에서 학습하므로, 초기 훈련 단계에서 기울기 분산이 감소한다.
  • 프레임워크는 깊이 카메라 관측치를 처리하고 상태 입력용 기하학적 표현을 생성하기 위해 3층의 컨볼루션 신경망을 사용한다.
  • 스위치 기능은 전체 센서 입력에 조건부로 구현된 신경망으로 구현되어 환경 맥락에 따라 적응적인 제어기 선택이 가능하다.
  • DDPG 정책이 충분한 성능을 달성한 후 히우리스틱 제어기를 점진적으로 비활성화할 수 있도록 지원하여 자율 운영을 가능하게 한다.

실험 결과

연구 질문

  • RQ1확률적 스위치 메커니즘이 복잡한 주행 작업에서 DDPG의 샘플 효율성과 훈련 안정성에 기여하는가?
  • RQ2탐색과 히우리스틱 가이던스 사이를 동적으로 전환하는 것이 기준 DDPG 대비 최종 주행 성능에 어떤 영향을 미치는가?
  • RQ3히우리스틱 가이던스를 사용해 훈련된 DDPG 정책이 추가 미세조정 없이 실제 환경으로 일반화되는 정도는 어느 정도인가?
  • RQ4훈련 후 DDPG 정책을 고립 상태에서 효과적으로 테스트할 수 있는가? 이는 가이던스가 성공적으로 내재화되었음을 시사한다.
  • RQ5히우리스틱 제어기의 선택이 DDPG 정책의 최종 성능 및 일반화 능력에 어떤 영향을 미치는가?

주요 결과

  • 제안된 프레임워크는 최신 기준 DDPG 기준 대비 유의미하게 뛰어난 주행 성능을 달성하며, 수렴 속도가 빠르고 훈련 분산이 낮다.
  • 모델은 시뮬레이션에서 훈련된 후 터틀봇과 깊이 카메라를 장착한 실제 환경으로 성공적으로 전이되어, 재훈련 없이도 여러 목표지점으로 충돌 없이 주행을 완료한다.
  • 훈련 후 DDPG 정책은 고립 상태에서 테스트 가능하며, 외부 제어기 의존 없이도 주행을 자율적으로 수행할 수 있음을 보여준다.
  • 프레임워크는 강력한 일반화 능력을 보이며, 다수의 독립된 제어기(PID 및 OA 등)의 혜택을 받으며, 더 많은 히우리스틱이 통합될수록 성능 향상이 이루어진다.
  • DDPG 정책이 충분히 능력을 갖추면 히우리스틱 제어기 의존도를 자동으로 감소시켜, 가이던스의 효과적인 내재화를 나타낸다.
  • 제거 실험 결과, 무작위 균일 스위칭 및 argmax 스위칭보다 확률적 스위치가 우수한 성능을 보이며, 학습된 스위칭 정책의 효과성을 입증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.