Skip to main content
QUICK REVIEW

[논문 리뷰] Imitating Human Behaviour with Diffusion Models

Tim Pearce, Tabish Rashid|arXiv (Cornell University)|2023. 01. 25.
Human Motion and Animation인용 수 23
한 줄 요약

확산 모델은 관찰에 조건된 행동의 전체 결합 분포를 학습하여 순차 환경에서 인간 행동을 모방하고, 로봇 제어 및 비디오 게임 과제에서 전통적 행동 복제 기준선을 능가합니다. 또한 본 논문은 신뢰할 수 있는 순차 모방을 위한 아키텍처, 가이던스 및 샘플링 전략을 분석합니다.

ABSTRACT

Diffusion models have emerged as powerful generative models in the text-to-image domain. This paper studies their application as observation-to-action models for imitating human behaviour in sequential environments. Human behaviour is stochastic and multimodal, with structured correlations between action dimensions. Meanwhile, standard modelling choices in behaviour cloning are limited in their expressiveness and may introduce bias into the cloned policy. We begin by pointing out the limitations of these choices. We then propose that diffusion models are an excellent fit for imitating human behaviour, since they learn an expressive distribution over the joint action space. We introduce several innovations to make diffusion models suitable for sequential environments; designing suitable architectures, investigating the role of guidance, and developing reliable sampling strategies. Experimentally, diffusion models closely match human demonstrations in a simulated robotic control task and a modern 3D gaming environment.

연구 동기 및 목표

  • 관찰에 conditioning된 인간 행동의 전체적 다모드 분포를 모델링하려는 동기부여를 제시하고, 단순한 BC 가정에 의존하지 않습니다.
  • 확산 모델이 순차 환경에서 복잡한 행동 분포를 정확하게 포착할 수 있음을 시연합니다.
  • 관찰-에서-행동(task)에 확산 모델을 적합시키기 위한 아키텍처, 가이던스, 샘플링 혁신을 개발합니다.
  • 로봇 제어 및 현대 비디오게임 환경에서 확산 기반 BC를 강력한 기준선과 비교 평가합니다.

제안 방법

  • 노이즈 제거 확산 확률 모델(DDPM)을 적용하여 관찰-에서-행동 p(a|o)를 학습합니다.
  • observation 인코더와 디노이징 네트워크를 분리하고, Basic MLP, MLP Sieve, Transformer로 구성된 행동 벡터에 특화된 아키텍처를 설계합니다.
  • Classifier-Free Guidance(CFG)가 순차 관찰-에서-행동 작업에서 성능을 해친다는 것을 확인합니다.
  • 샘플링 롤아웃 중 높은 가능성의 행동을 선택하기 위한 안정적 샘플링 스킴(Diffusion-X, Diffusion-KDE)을 도입합니다.
  • 다음 작업들에서 확산 기반 BC를 MSE, Discretised, K-Means, K-Means+Residual, EBM 기준선과 비교합니다.

실험 결과

연구 질문

  • RQ1확산 모델이 p(a|o)의 전체 조건부 분포를 정확히 모델링하여 순차 환경에서 인간의 시범을 모방할 수 있는가?
  • RQ2아키텍처 선택(MLP, MLP Sieve, Transformer)이 확산 기반 BC 성능에 어떤 영향을 미치는가?
  • RQ3가이던스 메커니즘(CFG)이 순차 모방에 어떤 영향을 미치는가?
  • RQ4신뢰할 수 있는 샘플링 스킴(Diffusion-X, Diffusion-KDE)이 행동 샘플링의 신뢰성과 충실도를 개선하는가?
  • RQ5확산 기반 방법은 강력한 BC 기준선과 비교했을 때 복잡한 환경(로봇 제어 및 CS:GO 등)에 얼마나 확장되는가?

주요 결과

  • 확산 기반 BC는 로봇 제어 작업에서 여러 지표에 대해 모든 기준선을 능가하며, 과제 완료율 및 인간과의 분포적 유사성 등에서 우수한 성과를 보입니다.
  • 아키텍처 선택이 중요합니다: Transformer와 MLP Sieve가 Basic MLP를 능가하며, Transformer가 가장 우수한 지표를 낳지만 샘플링은 더 느립니다.
  • Classifier-Free Guidance(CFG)는 순차 관찰-에서-행동 작업의 성능을 저하시켜 덜 일반적인 궤적에 대한 편향을 증가시킵니다.
  • 샘플링 스킴 Diffusion-X 및 Diffusion-KDE가 표준 Diffusion BC보다 신뢰성과 충실도를 향상시키며, KDE는 다양성은 다소 감소시킬 수 있습니다.
  • CS:GO 유사 비디오 게임 과제에서 Diffusion-X가 인간 행동에 대한 Wasserstein 거리에서 최상위를 차지하고 게임 점수도 경쟁력을 보이며, 샘플링 속도는 느리지만 실현 가능합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.