Skip to main content
QUICK REVIEW

[논문 리뷰] Bisimulation Makes Analogies in Goal-Conditioned Reinforcement Learning

Philippe Hansen-Estruch, Amy Zhang|arXiv (Cornell University)|2022. 04. 27.
Reinforcement Learning in Robotics인용 수 5
한 줄 요약

이 논문은 목표 조건부 이sov유리티(GCB)를 제안하며, 기능적으로 동치인 상태 표현을 학습하여 유사한 작업 간에 스킬을 일반화할 수 있도록 하는 표현 학습 방법이다. 상태-목표 쌍의 거리 기반 추상화를 활용함으로써 GCB는 유사한 작업의 예시로부터 목표를 추론할 수 있도록 하여, 새로운 목표 일반화에서 평균 40%의 성공률을 달성하고, 특히 간섭 조건 하에서 기존의 자기지도 학습 방법보다 뛰어난 성능을 보인다.

ABSTRACT

Building generalizable goal-conditioned agents from rich observations is a key to reinforcement learning (RL) solving real world problems. Traditionally in goal-conditioned RL, an agent is provided with the exact goal they intend to reach. However, it is often not realistic to know the configuration of the goal before performing a task. A more scalable framework would allow us to provide the agent with an example of an analogous task, and have the agent then infer what the goal should be for its current state. We propose a new form of state abstraction called goal-conditioned bisimulation that captures functional equivariance, allowing for the reuse of skills to achieve new goals. We learn this representation using a metric form of this abstraction, and show its ability to generalize to new goals in simulation manipulation tasks. Further, we prove that this learned representation is sufficient not only for goal conditioned tasks, but is amenable to any downstream task described by a state-only reward function. Videos can be found at https://sites.google.com/view/gc-bisimulation.

연구 동기 및 목표

  • 정확한 목표 이미지가 필요 없이 유사한 작업 간에 스킬을 일반화할 수 있도록 기능적으로 동치인 표현을 학습함으로써 에이전트가 유사한 작업 간에 스킬을 일반화할 수 있도록 하는 것.
  • 정적 상태 불변성 대신 상태-목표 전이 기반의 작업 수준 유사성을 포착하는 표현 학습 목표를 개발하는 것.
  • 목표 조건부 및 상태 전용 보상 작업을 모두 지원하는 통합된 표현을 설계하는 것.
  • 에이전트가 유사한 시연를 통해 목표를 추론해야 하는 시뮬레이션 환경에서 방법을 평가하는 것.

제안 방법

  • 정책 행동에 따라 기능적으로 동치인 작업(상태-목표 쌍)을 그룹화하는 상태 추상화의 한 형태인 목표 조건부 이sov유리티(GCB)를 도입한다.
  • 기능적 유사성을 측정하기 위해 상태-목표 쌍 간의 맥락 기반 거리 함수를 정의함으로써 작업을 위한 연속적인 임베딩 공간을 가능하게 한다.
  • 유사한 작업 추상화가 임베딩 공간에서 가까워지도록 유도하는 대비 기반 목적 함수를 사용해 복합 표현을 학습한다.
  • 각 상태가 상태와 작업 추상화의 공동 임베딩으로 표현되는 쌍 상태 임베딩 공간을 사용하여 목표 전이를 가능하게 한다.
  • 모든 상태 전용 보상 함수에 대해 성능 일반화를 보장하는 새로운 값 경계를 적용한다.
  • 자기지도 대비 학습 목적 함수를 사용하여 환경의 시연 및 전이 데이터만으로 표현을 훈련한다.

실험 결과

연구 질문

  • RQ1정확한 목표 이미지가 필요 없이, 유사한 작업의 예시로부터 새로운 목표를 추론할 수 있는 표현을 학습할 수 있는가?
  • RQ2유사한 작업만을 목표 기술자로 제공받을 때, 학습된 표현이 새로운 환경으로의 일반화 성능은 얼마나 잘 이루어지는가?
  • RQ3제안된 GCB 표현이 표준 목표 조건부 강화학습 벤치마크에서 기존의 자기지도 표현 학습 방법보다 우수한가?
  • RQ4학습된 표현이 상태 전용 보상 함수로 정의된 임의의 후행 작업에 충분한가?
  • RQ5다양한 시각적 및 작업 구성(예: 다른 물체의 형태나 크기)에서도 기능적 동치성 표현을 포착할 수 있는가?

주요 결과

  • GCB는 에이전트가 유사한 작업의 예시로부터 목표를 추론해야 하는 목표 일반화 벤치마크에서 평균 40%의 성공률을 달성하여 강력한 유사성 추론 능력을 입증한다.
  • 간섭 조건이 없는 표준 목표 도달 작업에서는 GCB가 Drawer 환경에서 50% 이상의 성공률을 기록하며, VAE와 CCVAE를 제외한 모든 다른 표현 학습 기반 방법보다 뛰어난 성능을 보였다.
  • 실제 비디오 간섭 조건 하에서 GCB는 Button 및 Drawer 환경 모두에서 가장 우수한 성능을 보였으며, 시각적 노이즈에 대한 강건성을 입증했다.
  • 제거 실험 결과, 복합 단일 상태 표현 ψ가 필수적임을 확인하였으며, ψ를 포함하지 않은 GC-DBC는 성능이著しく 열 劣하다.
  • 이론적 분석을 통해 GCB 임베딩 공간에서의 ℓ₁ 거리가 상태 간의 가치 차이를 상한선으로 제시함을 보여주었으며, 이는 모든 상태 전용 보상 함수에 대해 성능 일반화를 보장한다.
  • 그림 5의 정성적 분석은 GCB 표현이 당면 채소와 무를 다듬는 것과 같은 유사한 작업 변환을 서로 다른 초기 상태 간에 포착함으로써 기능적 유사성을 잘 반영하고 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.