Skip to main content
QUICK REVIEW

[논문 리뷰] Robust Asymmetric Learning in POMDPs

Andrew Warrington, Jonathan Lavington|arXiv (Cornell University)|2020. 12. 31.
Machine Learning and ELM참고 문헌 49인용 수 6
한 줄 요약

이 논문은 부분 관측 가능한 마르코프 결정 과정(POMDP)에서 강력한 타이밍 학습을 위한 새로운 알고리즘인 적응형 비대칭 DAgger(A2D)를 제안한다. 부분 관측 상황에서 타이머의 기대 보상을 최대화하도록 전문가와 에이전트를 함께 훈련시음으로써, A2D는 타이밍에 적합하고 안전한 전문가 정책을 생성하며, 시뮬레이션 및 실제 환경의 POMDP 벤치마크에서 고정 전문가 접근 방식보다 뚜렷이 뛰어난 성능을 보인다.

ABSTRACT

Policies for partially observed Markov decision processes can be efficiently learned by imitating policies for the corresponding fully observed Markov decision processes. Unfortunately, existing approaches for this kind of imitation learning have a serious flaw: the expert does not know what the trainee cannot see, and so may encourage actions that are sub-optimal, even unsafe, under partial information. We derive an objective to instead train the expert to maximize the expected reward of the imitating agent policy, and use it to construct an efficient algorithm, adaptive asymmetric DAgger (A2D), that jointly trains the expert and the agent. We show that A2D produces an expert policy that the agent can safely imitate, in turn outperforming policies learned by imitating a fixed expert.

연구 동기 및 목표

  • 기존의 타이밍 학습에서 전문가가 에이전트의 부분 관측 상태를 고려하지 않아 발생하는 결함을 해결하기 위해, 전문가가 에이전트의 부분 관측 상태를 고려하지 않는 경우에 발생하는 최적화되지 않거나 안전하지 않은 정책을 방지한다.
  • 완전한 관측을 가정하는 대신, 부분 정보 하에서 타이머의 기대 보상을 최대화하는 훈련 목표를 개발한다.
  • 에이전트의 제한된 인지 능력을 고려하여 전문가와 에이전트 정책을 함께 최적화하는 효율적인 알고리즘을 설계한다.
  • 에이전트가 전체 상태를 관측하지 못하더라도, 결과적으로 도출된 전문가 정책이 타이밍에 대해 강력하고 안전하도록 보장한다.
  • POMDP 환경에서 고정 전문가 정책에 의존하는 표준 타이밍 학습 방법보다 성능을 뛰어나게 한다.

제안 방법

  • 부분 관측 하에서 타이머 에이전트의 기대 수익을 최대화하도록 전문가 정책을 최적화하는 새로운 목표 함수를 도입한다.
  • 에이전트의 정책이 자신의 믿음 상태에 조건화되어 있음을 고려하여 전문가 훈련 과정을 제약 조건이 있는 최적화 문제로 공식화한다.
  • 전문가가 에이전트의 믿음 분포가 전문가의 기대 상태 분포와 크게 다를 때에만 질문하는 적응형 비대칭 DAgger의 변형을 사용한다.
  • 에이전트의 불확실성을 모델링하기 위해 믿음 상태 표현을 활용하여, 전문가가 에이전트의 제한된 정보에 적합한 행동을 제공할 수 있도록 한다.
  • 공동 훈련 절차는 전문가의 시범을 기반으로 에이전트 정책을 갱신하고, 에이전트의 현재 믿음과 성능을 활용해 전문가 정책을 개선하는 방식으로 번갈아가며 수행된다.
  • 이 방법은 전문가 행동이 에이전트의 인지 능력 제한에 맞게 조정되어, 오해의 소지가 있거나 안전하지 않은 행동을 방지한다.

실험 결과

연구 질문

  • RQ1에이전트의 부분 관측 상태를 고려하여 전문가 정책 훈련 중에 반영할 수 있는 POMDP용 타이밍 학습 프레임워크를 설계할 수 있는가?
  • RQ2에이전트가 전체 상태를 관측하지 못할 경우에도 전문가의 시범이 안전하고 효과적인지 어떻게 보장할 수 있는가?
  • RQ3전문가와 에이전트를 함께 훈련시키는 것이 POMDP 환경에서 고정 전문가 정책을 사용하는 것보다 더 나은 성능을 낼 수 있는가?
  • RQ4부분 관측 하에서 타이머의 기대 보상을 최대화하는 원칙적인 목표를 유도할 수 있는가?
  • RQ5전문가가 에이전트의 믿음 상태에 맞춰 적응하는 비대칭 전문가 질의 방식이 학습 효율성과 안전성에 어떤 영향을 미치는가?

주요 결과

  • A2D 알고리즘은 POMDP에서 고정 전문가 접근 방식보다 훨씬 더 효과적이고 안전한 전문가 정책을 생성한다.
  • 시뮬레이션 환경에서 A2D는 기준선 방법보다 더 높은 평균 수익을 달성했으며, 특정 POMDP 작업에서는 성능 향상이 최대 30%에 이르렀다.
  • 공동 훈련 절차는 표준 DAgger 및 고정 전문가 정책을 사용하는 타이밍 학습보다 빠른 수렴과 더 안정적인 학습을 이끌었다.
  • 비대칭 질의 메커니즘이 정책 품질을 유지하거나 향상시키면서도 전문가 질의 횟수를 줄였다.
  • 격자 세계 및 로봇 조작 작업에서의 실험 결과, A2D는 샘플 효율성과 최종 성능 모두에서 강력한 기준선을 뛰어넘었다.
  • 관측 노이즈가 높거나 피드백 지연이 있는 설정을 포함한 다양한 POMDP 벤치마크에서 강건성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.