Skip to main content
QUICK REVIEW

[논문 리뷰] Is Conditional Generative Modeling all you need for Decision-Making?

Anurag Ajay, Yilun Du|arXiv (Cornell University)|2022. 11. 28.
Language and cultural evolution인용 수 31
한 줄 요약

이 논문은 오프라인 의사결정 problem을 조건부 확산 모델링으로 재정의하며, 반환 조건부 확산 모델(Decision Diffuser)이 TD 학습 없이도 경쟁력 있거나 우수한 정책을 낼 수 있고 제약 및 기술 구성의 유연한 처리를 가능하게 함을 보여준다.

ABSTRACT

Recent improvements in conditional generative modeling have made it possible to generate high-quality images from language descriptions alone. We investigate whether these methods can directly address the problem of sequential decision-making. We view decision-making not through the lens of reinforcement learning (RL), but rather through conditional generative modeling. To our surprise, we find that our formulation leads to policies that can outperform existing offline RL approaches across standard benchmarks. By modeling a policy as a return-conditional diffusion model, we illustrate how we may circumvent the need for dynamic programming and subsequently eliminate many of the complexities that come with traditional offline RL. We further demonstrate the advantages of modeling policies as conditional diffusion models by considering two other conditioning variables: constraints and skills. Conditioning on a single constraint or skill during training leads to behaviors at test-time that can satisfy several constraints together or demonstrate a composition of skills. Our results illustrate that conditional generative modeling is a powerful tool for decision-making.

연구 동기 및 목표

  • 조건부 생성 모델을 활용한 순차 의사결정의 동기 부여(전통적 RL을 넘어서는 의의).
  • 반환 조건부 확산 모델이 가치 함수 추정 없이도 부분적으로 최적이 아닌 오프라인 궤적을 고수익 계획으로 잇는지 보여줌.
  • 제약 및 기술에 조건화하여 테스트 시에 복합적 행동을 생성하는 방법을 시연.
  • 오프라인 데이터에서 궤적 수익을 극대화하기 위한 로우-온도 샘플링과 분류자-프리 가이던스를 제시.
  • 조건부 생성 모델링이 여러 오프라인 RL 기준선보다 성능이 우수함을 표준 벤치마크에서 입증

제안 방법

  • 상태만으로 이루어진 확산 프로세스로 궤적을 모델링하고 역역학을 사용해 행동을 얻는다.
  • 역확산 모델 p_theta를 학습하여 노이즈가 섞인 상태 시퀀스를 y(tau) ( 수익, 제약, 또는 기술)에 조건화해 디노이즈한다.
  • 명시적 Q-함수 없이도 고수익 또는 제약 충족 궤적을 생성하도록 분류자-프리 가이던스와 로우-온도 샘플링을 사용한다.
  • 수익, 제약 또는 기술에 조건화하여 최대 수익을 내고 다중 제약을 충족하며 또는 기술을 조합하는 행동을 생성한다.
  • 생성된 상태 전이로부터 실행 가능한 행동을 매핑하기 위해 역역학 모델 f_phi(s_t, s_{t+1})를 incorporate한다.
  • 확률적 최대우도 스타일의 목표와 간헐적 조건 드랍아웃이 있는 디노이징 손실을 사용하여 확산 모델과 역역학을 함께 학습한다.

실험 결과

연구 질문

  • RQ1반환 조건부 확산 모델이 동적 계획법이나 Q-함수 추정 없이도 오프라인 RL 성능을 회복하거나 능가할 수 있는가?
  • RQ2제약 및 기술 같은 추가 요인에 조건화하면 테스트 시점에 행동의 유연한 구성이 가능해지는가?
  • RQ3저온도 샘플링과 분류자 프리 가이던스가 오프라인 데이터를 고수익 궤적으로 바꾸는 데 효과적인가?
  • RQ4확산 기반 정책은 TD 기반 오프라인 RL 방법과 표준 벤치마크에서 어떻게 비교되는가?
  • RQ5다중 제약 및 다중 기술 시나리오를 다루고 추론 시에 이를 구성할 수 있는가?

주요 결과

  • Decision Diffuser는 D4RL 로움 모션 및 Kitchen 작업에서 여러 오프라인 RL 기준선(TD 방법)과 일치하거나 그 이상으로 성능을 발휘한다.
  • 저온도 샘플링이 분류자-프리 가이던스 방식을 사용할 때 기본 확산 모델보다 궤적 품질과 수익 최대화를 개선한다.
  • 역역학을 사용한 행동 추출이 평가된 환경에서 행동을 직접 확산시키는 것보다 더 나은 성능을 낸다.
  • Kuka Block Stacking에서 단일 및 다중 제약을 효과적으로 충족하며 BCQ와 CQL이 일부 작업에서 실패하는 경우보다 우수하다.
  • Unitree-go-running에서 다중 기술 조건화 시 가로막 사이의 보행 전환이 발생하는 궤적이 나오는 것을 보였고, 분류자 기반 분석은 생성된 시퀀스에서 보행 전환이 있음을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.