Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Maximum Entropy Behavior Cloning

Mostafa Hussein, Brendan Crowe|arXiv (Cornell University)|2021. 01. 04.
Adversarial Robustness in Machine Learning참고 문헌 26인용 수 4
한 줄 요약

이 논문은 최대 엔트로피 정책 학습 설정에서 엔트로피 기반 가중치를 활용하여 악성 시뮬레이션을 자동으로 탐지하고 배제하는 새로운 이mitation 학습 프레임워크인 Robust Maximum Entropy Behavior Cloning (RM-ENT)을 제안한다. 이 방법은 시뮬레이터나 추가 샘플이 필요 없이도 표준 행동 복제와 IRL에 비해 더 뛰어난 강건성과 샘플 효율성을 보이며, 특히 악성 데이터 오염 상황에서도 성능이 뛰어나다.

ABSTRACT

Imitation learning (IL) algorithms use expert demonstrations to learn a specific task. Most of the existing approaches assume that all expert demonstrations are reliable and trustworthy, but what if there exist some adversarial demonstrations among the given data-set? This may result in poor decision-making performance. We propose a novel general frame-work to directly generate a policy from demonstrations that autonomously detect the adversarial demonstrations and exclude them from the data set. At the same time, it's sample, time-efficient, and does not require a simulator. To model such adversarial demonstration we propose a min-max problem that leverages the entropy of the model to assign weights for each demonstration. This allows us to learn the behavior using only the correct demonstrations or a mixture of correct demonstrations.

연구 동기 및 목표

  • 악성 또는 잘못된 시뮬레이션으로 인해 정책 성능이 떨어지는 이mitation 학습의 핵심적 한계를 해결하기 위해.
  • 사전 레이블링이나 시뮬레이터 접근 없이도 악성 시뮬레이션을 자동으로 식별하고 제거할 수 있는 방법을 개발하기 위해.
  • 최대 엔트로피 원칙을 활용하여 노이즈가 있거나 악성 데이터가 존재하는 상황에서도 높은 성능과 샘플 효율성을 유지하기 위해.
  • 어떤 시뮬레이션이나 열악한 조건에서도 전문가 시뮬레이션만을 사용하여 강건한 정책 학습을 가능하게 하기 위해.
  • 데이터 오염 상황에서 표준 행동 복제와 역강화 학습의 정확성과 강건성 면에서 모두 슈퍼리어한 성능을 내기 위해.

제안 방법

  • 전문가 정책과 학습된 정책 간의 특징 기대치 일치를 제약 조건으로 하면서 정책 엔트로피를 최대화하는 최소-최대 최적화 문제를 설정한다.
  • 각 시뮬레이션의 기여도에 따라 정책 엔트로피에 기반한 적응형 가중치를 할당함으로써, 악성 또는 무작위 시뮬레이션을 효과적으로 식별하고 가중치를 낮춘다.
  • 제약 조건 최적화 문제를 해결하기 위해 라그랑주 릴랙세이션을 사용하며, 기울기 기반 방법을 통한 엔드 투 엔드 학습이 가능하다.
  • 신경망을 정책을 매개변수화하는 데 사용하며, 정책과 함께 가중치를 동시에 학습시켜 신뢰할 수 있는 시뮬레이션과 악성 시뮬레이션을 구분한다.
  • 이 방법은 시뮬레이터나 추가 롤아웃이 필요 없어 시간과 샘플 측면에서 효율적이다.
  • 정책 분포의 엔트로피를 시뮬레이션 품질의 대체 지표로 사용한다: 높은 엔트로피는 더 많은 무작위성 또는 악성 행동을 의미한다.

실험 결과

연구 질문

  • RQ1사전 레이블링이나 시뮬레이터 접근 없이도 행동 복제 프레임워크가 악성 시뮬레이션을 자동으로 탐지하고 제거할 수 있는가?
  • RQ2엔트로피 기반 가중치는 데이터 오염 상황에서 이mitation 학습의 강건성을 어떻게 향상시키는가?
  • RQ3제안된 방법이 악성 또는 무작위 시뮬레이션 존재 상황에서 표준 행동 복제와 IRL에 비해 어느 정도 뛰어나게 성능을 내는가?
  • RQ4대부분의 시뮬레이션이 악성일 경우에도 이 방법이 높은 성능을 유지할 수 있는가?
  • RQ5기존의 IRL 및 BC 접근법과 비교해 이 방법의 샘플 및 시간 효율성은 어떻게 되는가?

주요 결과

  • 5×5 그리드 월드에서 RM-ENT는 정확한 시뮬레이션에 대해 0.5의 가중치를 할당하고 악성 시뮬레이션에는 0.0을 할당하여 혼합 세트에서 83%의 정확도를 달성했다.
  • 무작위 시뮬레이션 존재 상황에서 이 프레임워크는 92%의 정확도를 달성하여 엔트로피 기반으로 무작위 또는 비정형 행동을 탐지할 수 있음을 입증했다.
  • 마운틴카 및 애크로봇 작업에서 RM-ENT는 악성 시뮬레이션을 도입한 상황에서도 안정적인 성능을 유지했고, BC 및 IRL의 정확도는 크게 떨어졌다.
  • OpenAI Gym 환경에서의 학습 시간 비교 결과, RM-ENT는 경쟁하는 IRL 및 BC 기반 모델보다 더 빠른 수렴을 보였다.
  • 악성 시뮬레이션이 정확한 시뮬레이션을 초월할 경우, 모든 방법이 무작위 유사 정책으로 수렴했지만, RM-ENT는 효과적인 탐지 덕분에 초기 단계에서 다른 방법들을 능가했다.
  • 오직 두 개의 정확한 시뮬레이션만 존재하는 상황에서도 이 프레임워크는 악성 시뮬레이션을 성공적으로 배제했으며, 낮은 신호 대 노이즈 비율 상황에서도 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.