Skip to main content
QUICK REVIEW

[논문 리뷰] Lipschitz-constrained Unsupervised Skill Discovery

Seohong Park, Jongwook Choi|arXiv (Cornell University)|2022. 02. 02.
Reinforcement Learning in Robotics인용 수 8
한 줄 요약

Lipschitz-제약 기반 기술 탐색(LSD)는 상태 표현에 Lipschitz 제약 조건을 도입하여 동적이고 광범위하며 다양한 기술을 유도하는 새로운 비지도 기술 탐색 방법을 제안한다. 이는 MuJoCo의 이동 및 조작 환경 전반에서 기술 다양성, 상태공간 커버리지, 그리고 하류 목표 추종 작업에서의 제로샷 성능 측면에서 MI 기반 방법을 능가한다.

ABSTRACT

We study the problem of unsupervised skill discovery, whose goal is to learn a set of diverse and useful skills with no external reward. There have been a number of skill discovery methods based on maximizing the mutual information (MI) between skills and states. However, we point out that their MI objectives usually prefer static skills to dynamic ones, which may hinder the application for downstream tasks. To address this issue, we propose Lipschitz-constrained Skill Discovery (LSD), which encourages the agent to discover more diverse, dynamic, and far-reaching skills. Another benefit of LSD is that its learned representation function can be utilized for solving goal-following downstream tasks even in a zero-shot manner - i.e., without further training or complex planning. Through experiments on various MuJoCo robotic locomotion and manipulation environments, we demonstrate that LSD outperforms previous approaches in terms of skill diversity, state space coverage, and performance on seven downstream tasks including the challenging task of following multiple goals on Humanoid. Our code and videos are available at https://shpark.me/projects/lsd/.

연구 동기 및 목표

  • 스케일링 및 역행성 변환에 대해 불변인 특성으로 인해 정적이고 변동성이 낮은 기술을 선호하는 MI 기반 기술 탐색 방법의 한계를 해결하기 위해.
  • 동적 이동 또는 조작 기술을 유도하기 위해 수동적인 특징 공학 또는 도메인 전용 사전 지식(예: x-y 좌표)이 필요하지 않도록 하기 위해.
  • 외부 보상 없이도 큰 상태공간 변동성과 장거리 행동을 내재적으로 촉진하는 기술 탐색 목표를 개발하기 위해.
  • 추가 학습이나 계획 없이도 학습된 표현을 사용해 하류 목표 추종 작업으로의 제로샷 전이를 가능하게 하기 위해.
  • 초기화 수치가 없고 구현이 단순한 방법을 제공하여 기술 다양성과 커버리지 향상을 이루면서도 강력한 하류 성능를 유지하기 위해.

제안 방법

  • 표현 함수가 유한한 상수로 Lipschitz 연속성을 유지하도록 제약을 두어 상태공간 내 이동 거리를 최대화하는 Lipschitz 제약 목표를 제안한다.
  • 스킬과 상태 간 상호정보량을 정규화된 최대화 문제로 설정하며, 큰 상태 변화를 유도하기 위해 Lipschitz 페널티를 추가한다.
  • 다른 잠재 변수가 서로 다른 거리 있는 상태 궤적을 유도하도록 보장하기 위해 대비 학습 프레임워크를 사용해 정책을 훈련한다.
  • 간단한 선형층을 사용해 목표 상태로의 스킬 잠재 변수를 직접 회귀함으로써 학습된 상태 표현을 제로샷 목표 추종에 활용한다.
  • 스킬 정책를 고정하고 하류 작업을 위해 계층적 메타컨트롤러를 상단에 훈련시켜 표준 RL 파ip라인과 통합한다.
  • 사전 훈련 중에 작업 전용 보상이나 내재적 형태 조정 없이도 이동(ant, humanoid) 및 조작(fix) 환경에 모두 적용한다.

실험 결과

연구 질문

  • RQ1상태 표현 함수에 Lipschitz 제약 조건을 적용하는 것이 비지도 기술 탐색에서 동적이고 다양한 기술을 효과적으로 촉진할 수 있는가?
  • RQ2수동적인 특징 공학 없이도 LSD가 MI 기반 베이스라인에 비해 상태공간 커버리지 및 기술 다양성 측면에서 뛰어난가?
  • RQ3LSD에서 학습된 표현이 추가 학습 없이도 복수의 목표로의 제로샷 목표 추종을 가능하게 하는가?
  • RQ4LSD는 Humanoid에서의 다목표 탐색 및 Fetch 환경에서의 물체 조작과 같은 도전적인 하류 작업에서 어떻게 성능을 내는가?
  • RQ5LSD는 이동 및 조작을 포함한 다양한 유형의 로봇 제어 작업에서 강건하고 일반화 가능한가?

주요 결과

  • LSD는 다섯 개인 MuJoCo 환경 전반에서 가장 높은 상태공간 커버리지 성능를 기록하며, DIAYN 및 MDP와 같은 MI 기반 베이스라인을 크게 능가한다.
  • AntMultiGoals 및 HumanoidMultiGoals 작업에서 LSD는 조건부 내재 보상 또는 사전 지식이 있는 방법들조차도 초월하는 최종 누적 보상 성능를 달성한다.
  • 재학습 없이도 LSD의 제로샷 스킬 선택 성능이 AntMultiGoals에서 최고이며, 다른 작업들에서도 경쟁력 있는 성능를 유지한다. 이는 뛰어난 일반화 능력을 보여준다.
  • Fetch 조작 작업에서 LSD는 궤적도를 통해 x-y 평면 전역에 걸쳐 목표 물체를 가장 다양한 방향으로 이동시키는 것을 학습한다.
  • 모든 세 개인 Fetch 환경에서 LSD는 상태공간 커버리지(0.1×0.1 격자 기준) 측정에서 최고 성능를 기록하여 뛰어난 탐색 능력과 기술 다양성을 입증한다.
  • 추가 하이퍼파rameter가 필요 없으며 간편하게 구현 가능함에도 불구하고, 특징 공학 또는 내재 보상이 필요한 복잡한 베이스라인을 능가한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.