Skip to main content
QUICK REVIEW

[论文解读] Learning a Multi-Modal Policy via Imitating Demonstrations with Mixed Behaviors

Fang-I Hsiao, Jui-Hsuan Kuo|arXiv (Cornell University)|Mar 25, 2019
Multimodal Machine Learning Applications参考文献 32被引用 7
一句话总结

该论文提出一种具有分类潜变量的变分自编码器,用于从无行为标签的混合专家演示中学习多模态策略。通过离散潜因子解耦不同行为,该方法可通过条件控制实现精确的行为控制,在高维视觉输入任务及未知行为数量的零样本泛化方面,性能与监督方法相当。

ABSTRACT

We propose a novel approach to train a multi-modal policy from mixed demonstrations without their behavior labels. We develop a method to discover the latent factors of variation in the demonstrations. Specifically, our method is based on the variational autoencoder with a categorical latent variable. The encoder infers discrete latent factors corresponding to different behaviors from demonstrations. The decoder, as a policy, performs the behaviors accordingly. Once learned, the policy is able to reproduce a specific behavior by simply conditioning on a categorical vector. We evaluate our method on three different tasks, including a challenging task with high-dimensional visual inputs. Experimental results show that our approach is better than various baseline methods and competitive with a multi-modal policy trained by ground truth behavior labels.

研究动机与目标

  • 解决从无预定义行为标签的无标签混合演示中学习多种行为的挑战。
  • 开发一种可控策略,通过条件化离散潜码重现特定行为。
  • 实现在未预先知晓数据中行为数量的情况下,发现独立行为的零样本能力。
  • 将方法扩展至高维视觉输入任务,如自动驾驶场景。
  • 在无真实行为标注的情况下,超越现有的模仿学习与基于VAE的方法,在多模态行为学习中表现更优。

提出的方法

  • 使用具有分类潜变量的变分自编码器(VAE),对混合演示中的离散行为模式进行建模。
  • 编码器从演示轨迹中推断对应特定行为的分类潜因子。
  • 解码器作为策略,根据分类潜码生成动作以重现对应行为。
  • 为连续潜变量使用标准高斯先验,为离散行为码使用分类先验,实现解耦表征学习。
  • 通过从GoogLeNet的倒数第二层提取视觉特征,实现迁移学习,适用于自动驾驶等高维输入任务。
  • 采用重参数化技巧实现VAE的端到端训练,通过Gumbel-Softmax使反向传播能通过离散潜变量。

实验结果

研究问题

  • RQ1具有分类潜变量的VAE能否有效从无标签混合演示中发现并解耦多个独立行为?
  • RQ2通过条件化离散潜码,学习到的策略是否能在无行为标签的情况下实现对每种行为的高保真复现?
  • RQ3该方法能否泛化至高维视觉输入,如自动驾驶场景?
  • RQ4在未预先知晓数据中行为数量的情况下,模型是否能发现所有独立行为?
  • RQ5与监督基线方法及其他基于VAE的方法相比,该方法在行为解耦与复现准确率方面表现如何?

主要发现

  • 在机器人臂任务中,该方法成功学习并重现了8种不同行为,通过条件化独热向量达到专家速度。
  • 在TORCS汽车驾驶任务中,面对高维视觉输入,模型仅使用图像特征即清晰分离出方向与速度行为,展现出强大的泛化能力。
  • 当类别数超过实际行为数时,模型仍能发现所有独立行为,并将相似行为归为一类,表明对过参数化的鲁棒性。
  • 当类别数少于实际行为数时,模型仍能识别并分离出不同行为,显示出发现潜在结构的灵活性。
  • 尽管缺乏真实行为标注,该方法性能与使用真实行为标签训练的监督多模态策略相当。
  • 该模型能泛化至未见行为,并在类别数未知的情况下仍保持解耦表征。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。