Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarial Option-Aware Hierarchical Imitation Learning

Mingxuan Jing, Wenbing Huang|arXiv (Cornell University)|2021. 06. 10.
Reinforcement Learning in Robotics참고 문헌 30인용 수 9
한 줄 요약

이 논문은 장기 시간 간격 작업을 옵션으로 모델링하고, 옵션 확장된 점유도 측정 일치를 통한 적대적 최적화 방식으로 정책을 훈련시키는 새로운 계층적 타깃 학습 프레임워크인 Option-GAIL을 제안한다. EM 유사 알고리즘을 사용해 고수준 및 저수준 정책을 동시에 최적화하며, 로봇의 이동 및 조작 작업에서 최신 기준(SOTA) 기준선보다 더 빠른 수렴 속도와 뛰어난 성능을 달성한다.

ABSTRACT

It has been a challenge to learning skills for an agent from long-horizon unannotated demonstrations. Existing approaches like Hierarchical Imitation Learning(HIL) are prone to compounding errors or suboptimal solutions. In this paper, we propose Option-GAIL, a novel method to learn skills at long horizon. The key idea of Option-GAIL is modeling the task hierarchy by options and train the policy via generative adversarial optimization. In particular, we propose an Expectation-Maximization(EM)-style algorithm: an E-step that samples the options of expert conditioned on the current learned policy, and an M-step that updates the low- and high-level policies of agent simultaneously to minimize the newly proposed option-occupancy measurement between the expert and the agent. We theoretically prove the convergence of the proposed algorithm. Experiments show that Option-GAIL outperforms other counterparts consistently across a variety of tasks.

연구 동기 및 목표

  • 분할되지 않은, 애너테이션 없는 시범 데이터로부터 장기 시간 간격 스킬을 학습하는 데 도전한다.
  • 기존 계층적 타깃 학습(HIL) 방법에서 흔히 발생하는 누적 오차와 비최적 해를 극복한다.
  • 이론적으로 탄탄한, 종단 간 훈련이 가능한 프레임워크를 개발하여 고수준 및 저수준 정책을 동시에 최적화한다.
  • 전문가와 에이전트 간 일관된 옵션 전환을 보장하기 위해 점유도 측정 일치 과정에 옵션을 통합한다.
  • 전문가 옵션 애너테이션 없이도 복잡한 계층적 정책 학습에 대해 수렴 보장이 보장되는 훈련 알고리즘을 제공한다.

제안 방법

  • 계층적 의사결정을 가능하게 하기 위해 표준 MDP를 옵션 모델로 대체하여 하위 작업 분해를 가능하게 한다.
  • 정책과 그에 의해 유도된 측정치 사이의 일대일 대응을 보장하기 위해, 상태-행동-옵션 분포를 캡처하는 새로운 옵션 점유도 측정치를 도입한다.
  • EM 유사 알고리즘을 제안: E단계는 에이전트 정책과 시범 데이터를 조건으로 하여 전문가 옵션을 추론하기 위해 비터비 디코딩을 사용한다; M단계는 고수준 및 저수준 정책을 모두 업데이트한다.
  • M단계에서 최소-최대 생성 적대적 프레임워크를 활용: 판별기는 전문가와 에이전트의 옵션 점유도 간의 격리 정도를 추정하고, 정책은 이 비용을 최소화하도록 계층적 강화 학습을 통해 업데이트된다.
  • M단계의 정책 업데이트를 최적화하기 위해 계층적 강화 학습 방법(Zhang & Whiteson, 2019)을 사용하여 수준 간 효과적인 책임 할당을 보장한다.
  • 약한 조건 하에서 이론적 수렴성을 증명하여, EM 스타일 훈련 루프의 안정성을 확립한다.

실험 결과

연구 질문

  • RQ1옵션 확장된 점유도 측정 일치는 기존의 점유도 측정 일치보다 계층적 타깃 학습에서 정책 일치 정확도를 향상시키는가?
  • RQ2종단 간 훈련을 통해 고수준 및 저수준 정책을 동시에 최적화하는 방식은 두 단계 또는 별도의 훈련 접근 방식보다 우월한가?
  • RQ3옵션 추론 및 정책 업데이트 루프를 반복하는 EM 유사 알고리즘은 전문가 옵션 애너테이션 없이도 안정적이고 수렴 가능한 훈련을 달성할 수 있는가?
  • RQ4옵션 클래스의 수가 학습된 계층적 정책의 성능 및 표현력에 어떤 영향을 미치는가?
  • RQ5Option-GAIL은 최신 기준 기반의 HIL/IL 기준선 대비 장기 시간 간격 로봇 작업에서 누적 오차를 얼마나 줄이고 최종 성능을 향상시키는가?

주요 결과

  • Option-GAIL은 여러 로봇 이동 및 조작 작업에서 최신 기준(SOTA) HIL 및 IL 기준선보다 유의미하게 더 빠른 수렴 속도와 더 나은 최종 성능를 달성한다.
  • 절단 실험 결과, 무작위 옵션 할당은 성능을 심각하게 떨어뜨리며, 정확한 옵션 추론의 필요성을 확인한다.
  • 판별기 입력에서 이전 옵션 $o_{t-1}$을 생략할 경우 성능 저하가 발생함을 확인하여, 옵션 역학에서 시간적 일관성의 중요성을 입증한다.
  • 고수준 정책을 별도로 사전 훈련하는 방식(두 단계 방법)은 비최적 성능을 초래함을 확인하여, 종단 간 동시 훈련의 이점을 검증한다.
  • 옵션 클래스 수에 대해 모델은 강인하다: $|o| \geq 3$일 경우 성능가 안정화되며 활성 옵션 수는 약 3개로 유지되어 여분의 옵션 자동 제거가 이루어짐을 시사한다.
  • 모델는 전문가와 에이전트 간 협동적 옵션 전환을 성공적으로 학습하였으며, GAIL-HRL에서 관찰된 일관성 없는 전환 현상과는 다르게, 옵션 인식 일치의 필요성을 검증한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.