Skip to main content
QUICK REVIEW

[논문 리뷰] Domain-Robust Visual Imitation Learning with Mutual Information Constraints

Edoardo Cetin, Oya Çeliktutan|arXiv (Cornell University)|2021. 03. 08.
Human Pose and Action Recognition참고 문헌 36인용 수 4
한 줄 요약

이 논문은 도메인에 강건한 시각적 암시 학습 프레임워크인 DisentanGAIL을 제안한다. 이는 상호정보 제약 조건으로 정규화된 잠재 표현 병렬 구조를 갖는 적대적 훈련을 사용하여 작업 완료 신호와 도메인 특화된 변동성을 분리한다. 이 방법은 다른 전문가 에이전트의 고차원 관측에서 효과적으로 암시 학습을 가능하게 하며, 외관과 에이전트의 신체적 특성에서 심각한 도메인 이동이 발생하는 다양한 제어 작업에서 뛰어난 성능을 달성한다.

ABSTRACT

Human beings are able to understand objectives and learn by simply observing others perform a task. Imitation learning methods aim to replicate such capabilities, however, they generally depend on access to a full set of optimal states and actions taken with the agent's actuators and from the agent's point of view. In this paper, we introduce a new algorithm - called Disentangling Generative Adversarial Imitation Learning (DisentanGAIL) - with the purpose of bypassing such constraints. Our algorithm enables autonomous agents to learn directly from high dimensional observations of an expert performing a task, by making use of adversarial learning with a latent representation inside the discriminator network. Such latent representation is regularized through mutual information constraints to incentivize learning only features that encode information about the completion levels of the task being demonstrated. This allows to obtain a shared feature space to successfully perform imitation while disregarding the differences between the expert's and the agent's domains. Empirically, our algorithm is able to efficiently imitate in a diverse range of control problems including balancing, manipulation and locomotive tasks, while being robust to various domain differences in terms of both environment appearance and agent embodiment.

연구 동기 및 목표

  • 에이전트 자신의 시점에서가 아니라 다른 에이전트의 시점에서 관측된 전문가 시연가 존재할 경우 시각적 암시 학습의 과제를 해결한다.
  • 촉각적 또는 원격 제어 시범에 의존하는 에이전트 중심의 암시 학습의 한계를 극복하여 자연스럽지 않은 사용자-에이전트 상호작용을 방지한다.
  • 환경 외관과 에이전트의 신체적 특성에서의 도메인 이동이 발생하더라도 고차원 제어 작업에서 효과적인 암시 학습을 가능하게 한다.
  • 수작업으로 설계된 특징이나 작업 구조에 대한 강력한 가정에 의존하지 않고도 작업 완료 수준의 도메인 불변 표현을 학습하는 방법을 개발한다.
  • 생성적 적대적 프레임워크에서 상호정보 제약 조건을 적용하여 복잡한 실제 세계의 암시 학습 시나리오에 대한 강건성과 확장 가능성을 확보한다.

제안 방법

  • 작업 완료와 관련된 정보만 인코딩하는 잠재 블로킹을 갖는 새로운 디스criminator를 도입하며, 이는 상호정보 제약 조건에 의해 정규화된다.
  • 두 가지 상호정보 제약 조건을 강제 적용한다: 하나는 잠재 표현과 관측의 기원(에이전트 대 전문가) 간의 관계에 대해, 다른 하나는 도메인 정보가 잠재 공간에 인코딩되지 않도록 방지한다.
  • 훈련 안정성을 향상시키고 상호정보 추정 중 도메인 정보가 위장되는 것을 방지하기 위해 双통계 네트워크(2St)를 구현한다.
  • 디스criminator의 레이어에 스펙트럼 정규화를 적용하여 훈련 안정성을 향상시키고 모드 붕괴를 방지한다.
  • 오프-폴리시 강화 학습을 사용하여 적대적 디스criminator에서 파생된 보상 신호를 기반으로 에이전트를 훈련시킨다.
  • 배경 외관이나 에이전트 형태와 같은 관련 없는 도메인 특징에서 목표 완료 신호를 분리할 수 있도록 모델을 설계한다.

실험 결과

연구 질문

  • RQ1상호정보 제약 조건이 시각적 관측에서 도메인 특화된 변동성과 작업 완료 신호를 효과적으로 분리하는 데 기여하는가?
  • RQ2환경 외관과 에이전트의 신체적 특성에서 심각한 도메인 이동이 발생할 경우 제안된 방법의 성능은 어떠한가?
  • RQ3도메인 정보의 위장이 상호정보 추정에 미치는 영향은 무엇이며, 훈련 중에 이를 어떻게 완화할 수 있는가?
  • RQ4제안된 아키텍처는 로케모션 및 만능 제어 작업과 같은 고차원 제어 작업에 확장 가능한가?
  • RQ5스펙트럼 정규화 및 이중 통계 네트워크와 같은 아키텍처 구성 요소가 훈련 안정성과 성능에 기여하는 방식은 어떠한가?

주요 결과

  • DisentanGAIL은 Reacher, Inverted Pendulum, Hopper, 7DOF-Pusher와 같은 다양한 제어 작업에서 최신 기술 수준의 성능을 달성하며, 각각 Reacher와 Inverted Pendulum 작업에서 평균 수익률이 0.973±0.074 및 1.021±0.023을 기록한다.
  • 이 방법은 도메인 이동에 강건함을 보여준다: 배경가 변경된 대체 목표 환경(예: Hopper의 어두운 바닥, 7DOF-Pusher의 초록색 테이블)에서도 성능이 유지되며, Hopper에서는 0.709±0.078, 7DOF-Pusher에서는 0.835±0.039의 수익률을 기록했고, 원래 환경의 0.749±0.026 및 0.901±0.044와 비교해도 높은 성능 유지를 보였다.
  • 제거 실험 결과, 스펙트럼 정규화와 이중 통계 네트워크 모두 성능 향상에 기여하며, 특히 Inverted Pendulum 작업에서 후자는 약간 더 큰 영향을 미쳤다.
  • 스펙트럼 정규화를 제거하면 초기 수렴 속도는 빨라지지만 훈련 안정성이 떨어지므로 속도와 강건성 사이의 상충 관계가 드러났다.
  • 이중 통계 네트워크는 도메인 정보의 위장을 효과적으로 방지하여, 그렇지 않을 경우 상호정보 추정이 악화되고 정책 성능이 저하됨을 확인했다.
  • 모델은 바닥 타일 외관과 같은 관련 없는 도메인 특징에서 작업 관련 특징을 성공적으로 분리하여, 외관이 크게 다를 경우에도 효과적인 암시 학습을 가능하게 했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.