Skip to main content
QUICK REVIEW

[论文解读] Imitating Human Behaviour with Diffusion Models

Tim Pearce, Tabish Rashid|arXiv (Cornell University)|Jan 25, 2023
Human Motion and Animation被引用 23
一句话总结

扩散模型通过学习条件在观测值上的联合分布来模仿顺序环境中的人类行为,在机器人控制和视频游戏任务中超越传统行为克隆基线。论文还分析了用于可靠序列模仿的架构、引导和采样策略。

ABSTRACT

Diffusion models have emerged as powerful generative models in the text-to-image domain. This paper studies their application as observation-to-action models for imitating human behaviour in sequential environments. Human behaviour is stochastic and multimodal, with structured correlations between action dimensions. Meanwhile, standard modelling choices in behaviour cloning are limited in their expressiveness and may introduce bias into the cloned policy. We begin by pointing out the limitations of these choices. We then propose that diffusion models are an excellent fit for imitating human behaviour, since they learn an expressive distribution over the joint action space. We introduce several innovations to make diffusion models suitable for sequential environments; designing suitable architectures, investigating the role of guidance, and developing reliable sampling strategies. Experimentally, diffusion models closely match human demonstrations in a simulated robotic control task and a modern 3D gaming environment.

研究动机与目标

  • 以建模在观测条件下的完整多模态人类动作分布为动机,而不是依赖简化的行为克隆假设。
  • 证明扩散模型能够在序列环境中准确捕捉复杂的动作分布。
  • 开发用于将扩散模型应用于观测到行动任务的架构、引导和采样创新。
  • 在机器人控制和现代视频游戏环境中评估基于扩散的行为克隆,与强基线进行比较。

提出的方法

  • 将去噪扩散概率模型(DDPM)应用于学习观测到行动任务中的 p(a|o)。
  • 设计面向动作向量的架构(Basic MLP、MLP Sieve、Transformer),具有独立的观测编码器和去噪网络。
  • 研究Classifier-Free Guidance (CFG) 在顺序观测到行动任务中的性能下降。
  • 引入可靠的采样方案(Diffusion-X、Diffusion-KDE)在展开过程中选择高似然性的行动。
  • 在各任务中将扩散基础的 BC 与 MSE、Discretised、K-Means、K-Means+Residual、EBM 基线进行比较。

实验结果

研究问题

  • RQ1扩散模型是否能够准确建模条件分布 p(a|o) 以在顺序环境中模仿人类示例?
  • RQ2架构选择(MLP、MLP Sieve、Transformer)如何影响扩散基础 BC 的性能?
  • RQ3引导机制(CFG)对顺序模仿有何影响?
  • RQ4可靠的采样方案(Diffusion-X、Diffusion-KDE 是否提升行动采样的鲁棒性和保真度?
  • RQ5相较于强基线,扩散基础方法在复杂环境(机器人控制与 CS:GO)中的扩展性表现如何?

主要发现

  • 扩散基础的 BC 在机器人控制任务上超越所有基线,且在多项指标上表现优异,包括任务完成率和与人类的分布相似度。
  • 架构选择重要:Transformer 和 MLP Sieve 优于基础的 MLP;Transformers 在指标上最好,但采样速度较慢。
  • Classifier-Free Guidance (CFG) 在顺序观测到行动任务中会降低性能,增加对不常见轨迹的偏差。
  • 采样方案 Diffusion-X 与 Diffusion-KDE 提高了相对于标准 Diffusion BC 的鲁棒性和保真度,尽管 KDE 可能降低多样性。
  • 在类似 CS:GO 的视频游戏任务中,Diffusion-X 在对人类行动的 Wasserstein 距离上表现最好,游戏分数也具有竞争力,采样速率较慢但可行。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。