[논문 리뷰] MEGA-DAgger: Imitation Learning with Multiple Imperfect Experts
MEGA-DAgger는 다수의 불완전한 전문가로부터 상호작용형 강화학습을 위한 새로운 DAgger 변종으로, 안전성 인식 데이터 필터를 사용해 위험한 시연를 제거하고, 지표 기반 전문가 평가 시스템을 통해 레이블 충돌을 해결한다. 이는 자율 주행에서 모든 개별 전문가와 최신 기준보다 뛰어난 성능을 보이는 정책을 학습하며, 충돌 회피와 추월 성능에서 각각 평균 13.6% 및 13.2% 향상된다.
Imitation learning has been widely applied to various autonomous systems thanks to recent development in interactive algorithms that address covariate shift and compounding errors induced by traditional approaches like behavior cloning. However, existing interactive imitation learning methods assume access to one perfect expert. Whereas in reality, it is more likely to have multiple imperfect experts instead. In this paper, we propose MEGA-DAgger, a new DAgger variant that is suitable for interactive learning with multiple imperfect experts. First, unsafe demonstrations are filtered while aggregating the training data, so the imperfect demonstrations have little influence when training the novice policy. Next, experts are evaluated and compared on scenarios-specific metrics to resolve the conflicted labels among experts. Through experiments in autonomous racing scenarios, we demonstrate that policy learned using MEGA-DAgger can outperform both experts and policies learned using the state-of-the-art interactive imitation learning algorithms such as Human-Gated DAgger. The supplementary video can be found at \url{https://youtu.be/wPCht31MHrw}.
연구 동기 및 목표
- 기존 상호작용형 이민화 학습 방법이 단일 완벽한 전문가에 접근 가능하다는 가정을 해결하기 위해.
- 여러 불완전한 전문가(각각 위험하거나 상충되는 행동을 보임)가 시연를 제공할 때 효과적인 이민화 학습을 가능하게 하기 위해.
- 상호작용 학습 중에 위험한 전문가 시연를 필터링하고 전문가 간 행동 충돌을 해결하는 프레임워크를 개발하기 위해.
- 종합적인 자율 주행에서 안전성과 성능 면에서 모든 개별 전문가를 초월하는 초보자 정책을 학습하기 위해.
제안 방법
- 제어 장벽 함수 기반의 안전성 스코어러를 사용해 데이터 집합 과정에서 위험한 전문가 시연를 평가하고 필터링한다.
- 안전성과 진전도 지표를 각 전문가에 대해 계산하는 이중 스코어 평가 메커니즘을 통해 충돌 시 가장 우수한 행동을 순위 매기고 선택한다.
- 초보자 정책이 각 전문가 개입 후 재학습되는 DAgger 유사 상호작용 루프에 전문가 피드백을 통합한다.
- 학습된 안전성 임계값(실험에서 β = 70단계) 기반으로 전문가 로울아웃에서 위험한 세그먼트를 제거하는 데이터 잘라내기 전략을 적용한다.
- 동일한 관측 조건에서 다수의 전문가가 제시한 충돌하는 행동은 안전성과 진전도 스코어의 합계가 가장 높은 행동을 선택함으로써 해결한다.
- 이 방법은 안전성과 진전도가 모두 중요한 성능 지표인 엔드 투 엔드 자율 주행에 적용된다.
실험 결과
연구 질문
- RQ1전문가 시연에 위험한 행동이 포함되어 있을 때 상호작용형 이민화 학습이 다수의 불완전한 전문가를 효과적으로 활용할 수 있는가?
- RQ2정책 학습 중에 다수의 전문가로부터 발생하는 충돌 행동을 어떻게 해결하여 성능 저하를 방지할 수 있는가?
- RQ3여러 불완전한 전문가로부터 학습한 정책이 안전성과 성능 면에서 모든 개별 전문가를 초월할 수 있는가?
- RQ4위험한 시연를 필터링하는 것이 자율 주행에서 최종 정책의 안전성과 일반화 능력에 어떤 영향을 미치는가?
- RQ5제안된 전문가 평가 및 선택 메커니즘은 전문가 행동을 단순 평균화하거나 무작위 선택하는 것과 비교해 어떻게 다른가?
주요 결과
- MEGA-DAgger는 최고의 개별 전문가 대비 평균 13.6% 충돌률 감소를 기록하여 충돌 비율을 0.212 ± 0.019로 낮췄다.
- 최고의 전문가 대비 추월 성능을 13.2% 향상시켜 추월 비율을 0.781 ± 0.016로 확보했다.
- MEGA-DAgger로 학습된 정책는 충돌 회피 및 추월 성능 지표에서 둘 다 보편적 HG-DAgger와 데이터 필터링이 적용된 HG-DAgger를 모두 능가한다.
- 추월 및 충돌 회피 성능에서 MEGA-DAgger는 보편적 HG-DAgger 대비 평균 45% 향상, 데이터 필터링이 적용된 HG-DAgger 대비 15% 향상되었다.
- 학습된 정책는 개별 전문가보다 성능 변동 폭이 작아 더 높은 안정성을 보였다.
- 시각화 결과 정책가 다양한 전문가로부터 상호보완적인 안전 행동을 학습함을 확인했으며, 개별 전문가들이 공통으로 피하는 충돌 위험 영역을 회피하는 경향을 보였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.