Skip to main content
QUICK REVIEW

[논문 리뷰] Watch and Match: Supercharging Imitation with Regularized Optimal Transport

Siddhant Haldar, Vaibhav Mathur|arXiv (Cornell University)|2022. 06. 30.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

이 논문은 행동 복제(BC) 사전 훈련과 최적 운반(OT)을 통한 적응형 궤적 매칭 보상의 조합을 통해 정책 학습을 가속화하는 새로운 이민학습 알고리즘인 정규화된 최적 운반(ROT)을 제안한다. 소프트 Q-필터링 정규화를 통해 BC의 충실도와 탐색의 동적 균형을 유지함으로써, ROT는 시뮬레이션에서 전문가 성능의 90%에 도달하는 데에 7.8배 빠른 수렴 속도를 달성했으며, 한 개의 시범 예제와 한 시간의 온라인 훈련만으로도 실제 로봇 조작 작업에서 평균 90.1%의 성공률을 기록한다.

ABSTRACT

Imitation learning holds tremendous promise in learning policies efficiently for complex decision making problems. Current state-of-the-art algorithms often use inverse reinforcement learning (IRL), where given a set of expert demonstrations, an agent alternatively infers a reward function and the associated optimal policy. However, such IRL approaches often require substantial online interactions for complex control problems. In this work, we present Regularized Optimal Transport (ROT), a new imitation learning algorithm that builds on recent advances in optimal transport based trajectory-matching. Our key technical insight is that adaptively combining trajectory-matching rewards with behavior cloning can significantly accelerate imitation even with only a few demonstrations. Our experiments on 20 visual control tasks across the DeepMind Control Suite, the OpenAI Robotics Suite, and the Meta-World Benchmark demonstrate an average of 7.8X faster imitation to reach 90% of expert performance compared to prior state-of-the-art methods. On real-world robotic manipulation, with just one demonstration and an hour of online training, ROT achieves an average success rate of 90.1% across 14 tasks.

연구 동기 및 목표

  • 복잡한 제어 작업에서 광범위한 온라인 상호작용이 필요한 역강화학습(IRL) 방법의 샘플 비효율성을 해결한다.
  • 정책 업데이트로 인한 분포 이탈과 고분산 정책 기울기로 인한 IRL 훈련의 불안정성을 극복한다.
  • 오프라인 행동 복제와 온라인 궤적 매칭 보상을 조합하여 이민학습의 샘플 효율성을 향상시킨다.
  • 고차원 시각적 관측과 최소한의 하이퍼파rameter 튜닝을 필요로 하는 방법을 개발한다.
  • 최소한의 시범 예제와 온라인 롤아웃만으로도 빠르고 견고한 실제 로봇 제어에서의 이민학습을 가능하게 한다.

제안 방법

  • 온라인 탐색의 필요성을 줄이기 위해 전문가 시범 데이터로 행동 복제(BC) 정책을 사전 훈련한다.
  • 최적 운반(OT)을 사용하여 비모수적이고 궤적 매칭 보상을 계산하여 온라인 정책 최적화를 이끌어낸다.
  • 사전 훈련된 BC 정책과의 가까움과 탐색의 동적 균형을 유지하는 적응형 정규화 기법인 소프트 Q-필터링을 도입한다.
  • IRL 목표를 사전 훈련된 BC 정책에서의 큰 이탈을 방지하는 정규화된 최적화 문제로 공식화한다.
  • 수동적인 감쇠 스케줄을 피하기 위해 BC의 영향력을 점차 줄이는, 학습된 가중치 메커니즘을 사용하여 정규화를 적용한다.
  • OT 기반 보상과 소프트 Q-필터링 정규화를 사용하여 오프폴리시 강화학습(예: DrQ-v2)을 통해 최종 정책을 엔드 투 엔드로 훈련한다.

실험 결과

연구 질문

  • RQ1행동 복제 사전 훈련과 최적 운반 기반 보상의 조합이 복잡한 제어 작업에서 이민학습을 상당히 가속화할 수 있는가?
  • RQ2적응형 정규화(소프트 Q-필터링)는 수동 조정된 감쇠 스케줄에 비해 IRL 훈련의 안정성에 어떻게 기여하는가?
  • RQ3적응형 정규화와 비교했을 때, OT 기반 보상 계산은 적대적 IRL이나 수동으로 설계된 보상이 있는 표준 RL에 비해 샘플 효율성에 얼마나 기여하는가?
  • RQ4제안된 방법은 한 개의 시범 예제와 최소한의 온라인 상호작용만으로도 실제 로봇 조작에서 높은 성능을 달성할 수 있는가?
  • RQ5사전 훈련과 정규화 중 어느 것이 이민학습의 샘플 효율성에 더 큰 기여를 하는가?

주요 결과

  • ROT는 딥마인드 컨트롤 스위트, 오픈AI 로봇 스위트, 메타월드 벤치마크에서 20개의 시뮬레이션된 시각 제어 작업 전반에서 최신 기준 대비 7.8배 더 빠른 수렴 속도를 보이며 전문가 성능의 90%에 도달한다.
  • 한 명의 인간 시범 예제와 한 시간의 온라인 훈련만으로도 14개의 작업에서 실제 로봇 조작 작업에서 평균 90.1%의 성공률을 기록했으며, 행동 복제(36.1%)와 적대적 IRL(14.6%)에 비해 뚜렷한 성능 향상을 보였다.
  • 특정 작업에 맞는 보상 설계가 필요한 표준 딥 강화학습(예: DrQ-v2)보다 ROT가 뛰어나게 성능을 내었으며, 이는 OT와 정규화를 통한 이민학습이 보상 기반 RL에 맞먹거나 초월할 수 있음을 시사한다.
  • 제거 실험 결과, BC 사전 훈련과 소프트 Q-필터링 정규화 모두 필수적임을 확인했으며, 둘 중 하나를 제거하면 성능이 심각하게 저하된다.
  • 소프트 Q-필터링 메커니즘은 수동 조정된 감쇠 스케줄보다 더 안정적인 훈련을 가능하게 하며, 하이퍼파rameter 튜닝 없이도 더 빠른 수렴을 이룬다.
  • 이 설정에서는 적대적 IRL보다 OT 기반 보상이 더 효과적이며, 정규화와 조합되어 있어도 더 안정적이고 효율적인 학습을 유도한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.