Skip to main content
QUICK REVIEW

[논문 리뷰] Safe Driving via Expert Guided Policy Optimization

Zhenghao Peng, Quanyi Li|arXiv (Cornell University)|2021. 10. 13.
Reinforcement Learning in Robotics참고 문헌 39인용 수 4
한 줄 요약

이 논문은 안전한 탐색을 보장하고 수정 지시를 제공하는 가드리안(전문가 정책과 스위치 함수로 구성됨)을 통합한 새로운 전문가 인식 강화학습 방법인 전문가 가이드드 정책 최적화(EGPO)를 제안한다. 간섭 빈도를 제한하기 위한 제약 최적화와 오프라인 강화학습을 결합하여, 오프정책 지시에서 안정된 학습을 가능하게 함으로써, 안전 주행 과제에서 뛰어난 안전성, 샘플 효율성, 일반화 성능을 달성하며, 훈련 및 테스트 시 성능 모두에서 기준 모델을 크게 능가한다.

ABSTRACT

When learning common skills like driving, beginners usually have domain experts standing by to ensure the safety of the learning process. We formulate such learning scheme under the Expert-in-the-loop Reinforcement Learning where a guardian is introduced to safeguard the exploration of the learning agent. While allowing the sufficient exploration in the uncertain environment, the guardian intervenes under dangerous situations and demonstrates the correct actions to avoid potential accidents. Thus ERL enables both exploration and expert's partial demonstration as two training sources. Following such a setting, we develop a novel Expert Guided Policy Optimization (EGPO) method which integrates the guardian in the loop of reinforcement learning. The guardian is composed of an expert policy to generate demonstration and a switch function to decide when to intervene. Particularly, a constrained optimization technique is used to tackle the trivial solution that the agent deliberately behaves dangerously to deceive the expert into taking over. Offline RL technique is further used to learn from the partial demonstration generated by the expert. Safe driving experiments show that our method achieves superior training and test-time safety, outperforms baselines with a substantial margin in sample efficiency, and preserves the generalizabiliy to unseen environments in test-time. Demo video and source code are available at: https://decisionforce.github.io/EGPO/

연구 동기 및 목표

  • 실세계 강화학습에서의 안전성 훈련이라는 핵심 과제를 해결하기 위해, 특히 자율주행과 같은 고위험 분야에 적용한다.
  • 필요할 때만 간섭하고 수정 지시를 제공하는 인간-중심 가드리안을 통합하여 안전한 탐색을 가능하게 하는 프레임워크를 개발한다.
  • 에이전트가 전문가의 간섭을 악용하여 학습을 피하는 것을 방지하여, 견고하고 안전한 행동을 학습하도록 보장한다.
  • 전문가로부터의 부분적이고 오프정책 지시를 효과적으로 활용하여 샘플 효율성과 정책 일반화를 향상시킨다.
  • 높은 안전성과 성능을 보이며, 실제 주행 환경에서의 방법의 효과성을 입증한다.

제안 방법

  • 가드리안 메커니즘은 위험 행동을 탐지하고 전문가 간섭을 유도하는 스위치 함수와, 간섭 시 수정 행동을 제공하는 전문가 정책으로 구성된다.
  • 간섭 횟수를 제한하기 위해 라그랑주 기반 제약 최적화를 적용하여, 에이전트가 전문가의 안전성에 의존하도록 유도하는 것을 방지한다.
  • 라그랑주 승수는 PID 제어기를 통해 갱신되어 오프정책 강화학습에서 이중 최적화의 안정성을 향상시키며, 수렴성과 훈련 안정성을 개선한다.
  • CQL(보수적 Q-학습) 목적함수를 사용한 오프라인 강화학습을 통해 가드리안에서 수집한 오프정책 지시 데이터를 기반으로 에이전트를 훈련시킨다.
  • 온라인 탐색과 전문가 지시를 결합하며, 보상 신호는 간섭 발생 여부뿐이므로 효과적인 모방 학습이 가능하다.
  • 스위치 함수는 수동적인 규칙가 아닌 통계적 방법으로 학습되어 다양한 위험 상황에 일반화 가능하다.

실험 결과

연구 질문

  • RQ1간섭과 지시를 통합한 가드리안 메커니즘이 강화학습에서 안전성과 샘플 효율성을 향상시킬 수 있는가?
  • RQ2에이전트가 빈번한 간섭을 유도하여 학습을 피하는 것을 방지하기 위해선 어떻게 해야 하는가?
  • RQ3지시가 매우 오프정책적이고 부분적인 상황에서 오프라인 강화학습 기법이 정책 학습을 얼마나 안정화시킬 수 있는가?
  • RQ4기본 기준 모델과 비교해 볼 때, 제안된 방법이 새로운 환경에 더 잘 일반화되는가?
  • RQ5인간 감시가 비용이 많이 들 때에도, 최소한의 환경 상호작용으로 높은 성능을 달성할 수 있는가?

주요 결과

  • EGPO는 테스트 성공률 0.85 ± 0.05와 에피소드 수익 388.37 ± 10.01을 달성하여, 안전성과 샘플 효율성 측면에서 모두 기준 모델을 크게 능가한다.
  • 절단 실험 결과, 간섭 최소화 기능을 제거할 경우 에이전트가 도로 경계로 향해 운전하여 성공률가 0이 되고 비용이 1.0이 되어 그 필수성을 입증한다.
  • 낮은 품질의 전문가(성공률 30%)를 사용할 경우 훈련 비용이 증가하고 성능이 떨어지므로, 훈련 안전성이 전문가의 안전성에 의해 제한됨을 검증한다.
  • 라그랑주 승수 갱신을 위한 PID 제어기가 훈련을 안정화시키며, 이를 제거할 경우 극도로 불안정한 학습이 발생하여 그 중요성을 확인한다.
  • EGPO는 인간 데이터가 적은 경우에도 행동 복제와 IL 기준 모델을 능가하여, 모방 학습의 효율성을 입증한다.
  • 인간-중심 실험에서 EGPO는 오직 15,000개의 환경 스텝만으로 90%의 성공률를 달성했고, SAC-Lag는 185,000개의 스텝이 필요했으며, 이는 EGPO의 뛰어난 샘플 효율성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.