Skip to main content
QUICK REVIEW

[논문 리뷰] Generalized Decision Transformer for Offline Hindsight Information Matching

Hiroki Furuta, Yutaka Matsuo|arXiv (Cornell University)|2021. 11. 19.
Reinforcement Learning in Robotics인용 수 10
한 줄 요약

이 논문은 일반화된 의사결정 트랜스포머(GDT)를 소개한다. GDT는 뒤로 돌아와 정보 매칭(HIM)으로서의 학습을 프레임워크화함으로써 오프라인 강화학습을 위한 통합된 프레임워크로, 정책은 향후 궤적 통계에 조건화된다. 특징 함수와 반인과적 집계기의 변화를 통해 GDT는 기존 방법을 복원하고 새로운 변종—범주형 DT(CDT)와 이중방향 DT(BDT)를 도입한다. CDT는 상태의 주어진 분포 매칭을 위해 설계되었고, BDT는 한 번의 시도로도 모방 학습을 수행할 수 있도록 한다. 이는 오프라인 다중 작업 벤치마크에서 최고 성능을 기록하며, 새로운 및 합성 분포로의 일반화 능력도 향상시킨다.

ABSTRACT

How to extract as much learning signal from each trajectory data has been a key problem in reinforcement learning (RL), where sample inefficiency has posed serious challenges for practical applications. Recent works have shown that using expressive policy function approximators and conditioning on future trajectory information -- such as future states in hindsight experience replay or returns-to-go in Decision Transformer (DT) -- enables efficient learning of multi-task policies, where at times online RL is fully replaced by offline behavioral cloning, e.g. sequence modeling. We demonstrate that all these approaches are doing hindsight information matching (HIM) -- training policies that can output the rest of trajectory that matches some statistics of future state information. We present Generalized Decision Transformer (GDT) for solving any HIM problem, and show how different choices for the feature function and the anti-causal aggregator not only recover DT as a special case, but also lead to novel Categorical DT (CDT) and Bi-directional DT (BDT) for matching different statistics of the future. For evaluating CDT and BDT, we define offline multi-task state-marginal matching (SMM) and imitation learning (IL) as two generic HIM problems, propose a Wasserstein distance loss as a metric for both, and empirically study them on MuJoCo continuous control benchmarks. CDT, which simply replaces anti-causal summation with anti-causal binning in DT, enables the first effective offline multi-task SMM algorithm that generalizes well to unseen and even synthetic multi-modal state-feature distributions. BDT, which uses an anti-causal second transformer as the aggregator, can learn to model any statistics of the future and outperforms DT variants in offline multi-task IL. Our generalized formulations from HIM and GDT greatly expand the role of powerful sequence modeling architectures in modern RL.

연구 동기 및 목표

  • 뒤로 돌아와 정보 매칭(HIM)의 공통 원리에 기반해 다양한 뒤로 돌아와 기반의 강화학습 방법을 통합하는 것.
  • 최소한의 아키텍처 변경으로도 어떤 HIM 문제를 해결할 수 있도록 확장된 아키텍처인 GDT를 개발하는 것.
  • 미래의 통계, 예를 들어 상태 분포나 리턴-투-고를 매칭함으로써 효과적인 오프라인 다중 작업 학습을 가능하게 하는 것.
  • 범주형 DT(CDT)를 제안하고 검증하여 오프라인 다중 작업 상태 분포 매칭(SMM)을 수행하며, 합성 이중모달 분포로의 일반화도 가능하게 하는 것.
  • 한 번의 시도로도 모방 학습을 수행할 수 있도록 하는 이중방향 DT(BDT)를 도입하고, 이는 오프라인 다중 작업 모방 학습에서 기존 방법을 능가한다.

제안 방법

  • 정책이 향후 궤적 통계에 조건화되는 일반화된 프레임워크인 일반화된 의사결정 트랜스포머(GDT)를 제안하며, 이는 특징 함수 Φ(s,a)와 반인과적 집계기로 구성된다.
  • 시퀀스 모델링 목적을 갖는 행동 복제를 사용하여, 미래 정보의 목표 통계와 일치하는 궤적을 생성하는 정책을 훈련시킨다.
  • DT의 반인과적 합산을 분할 기반으로 대체함으로써, 상태 특징의 분포 매칭이 가능한 범주형 DT(CDT)를 도입한다.
  • 두 번째 트랜스포머를 반인과적 집계기로 사용하여, 임의의 미래 통계를 모델링할 수 있도록 이중방향 DT(BDT)를 개발한다.
  • 오프라인 다중 작업 SMM 및 모방 학습 작업에서 성능 평가를 위해 워샤르슈타인 거리 기반 메트릭을 사용한다.
  • 자기부호화 및 대조적 학습(CPC)을 포함한 다양한 학습된 특징 함수의 훈련 전략을 지원하며, 공동 최적화 대비 고정된 미세조정 전략의 영향을 분석한다.

실험 결과

연구 질문

  • RQ1일관된 미래 궤적 통계 매칭 원리에 기반해 다양한 뒤로 돌아와 기반의 강화학습 방법을 통합할 수 있는 프레임워크가 가능한가?
  • RQ2범주형 DT(CDT)는 새로운 및 합성 이중모달 보상 또는 상태 특징 분포로의 일반화를 포함해 효과적으로 오프라인 다중 작업 상태 분포 매칭을 수행할 수 있는가?
  • RQ3이중방향 DT(BDT)는 특히 한 번의 시도로도 모방 학습을 수행하는 설정에서 기존 방법을 능가할 수 있는가?
  • RQ4특징 함수와 반인과적 집계기의 다양한 선택이 SMM 및 IL 벤치마크에서 성능에 미치는 영향은 어떠한가?
  • RQ5학습된 특징 함수의 최적 성능를 얻기 위해 어떤 훈련 전략(예: 고정 vs. 공동 최적화)이 가장 효과적인가?

주요 결과

  • 범주형 DT(CDT)는 처음으로 효과적인 오프라인 다중 작업 상태 분포 매칭 알고리즘을 제공하며, 새로운 및 합성 이중모달 보상 또는 상태 특징 분포로의 일반화 능력이 뛰어나다.
  • BDT는 오프라인 다중 작업 모방 학습에서 기존 DT 변종보다 뛰어난 성능을 보이며, 특히 한 번의 시도로도 모방 학습을 수행하는 설정에서 경쟁적인 성능을 기록한다.
  • 제안된 워샤르슈타인 거리 메트릭은 SMM 및 IL 성능 평가에 효과적으로 사용되며, 다양한 작업 간 신뢰성 있는 비교를 가능하게 한다.
  • 학습된 특징 함수(예: 대조적 학습을 통한)를 사용한 GDT는 뛰어난 성능을 기록하며, 공동 최적화가 고정 또는 단순 무 supervision pretraining보다 더 좋은 결과를 낳는다.
  • 보상 기반 특징과 합산 집계를 사용할 경우, 표준 의사결정 트랜스포머가 특수한 경우로 성공적으로 복원된다.
  • 일반화된 아키텍처는 특징 함수와 집계기 구성 요소만 변경함으로써 다양한 오프라인 RL 문제에 쉽게 적응할 수 있도록 한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.