[论文解读] Interpretable Latent Spaces for Learning from Demonstration
本文提出了一种框架,通过在潜在空间中引入辅助分类损失,强制不同潜在维度与用户定义的语义概念组(如颜色、大小、形状)之间保持正交性,从而将变分自编码器中学习到的潜在表征与这些语义概念对齐。该方法实现了解耦且可解释的表征,支持鲁棒的1-NN分类与未知概念检测,在概念对齐和开放世界识别方面优于β-VAE等基线模型。
Effective human-robot interaction, such as in robot learning from human demonstration, requires the learning agent to be able to ground abstract concepts (such as those contained within instructions) in a corresponding high-dimensional sensory input stream from the world. Models such as deep neural networks, with high capacity through their large parameter spaces, can be used to compress the high-dimensional sensory data to lower dimensional representations. These low-dimensional representations facilitate symbol grounding, but may not guarantee that the representation would be human-interpretable. We propose a method which utilises the grouping of user-defined symbols and their corresponding sensory observations in order to align the learnt compressed latent representation with the semantic notions contained in the abstract labels. We demonstrate this through experiments with both simulated and real-world object data, showing that such alignment can be achieved in a process of physical symbol grounding.
研究动机与目标
- 通过将学习到的潜在表征与人类定义的语义概念对齐,实现在机器人从示范学习中的物理符号接地。
- 确保每个变化因子(如颜色、大小)被编码在独立的、线性可分的潜在维度中,以实现可解释性。
- 通过统一的潜在空间支持已知与未知概念的鲁棒推理(开放世界识别)。
- 通过利用弱标签化的示范数据,提升样本效率与模型可解释性。
- 证明仅使用最少的人类输入,即可在合成与真实世界设置中学习到解耦且可解释的表征。
提出的方法
- 训练一个变分自编码器(VAE),每个用户定义的概念组配备一个辅助分类头,每个分类头从单一潜在维度预测标签。
- 每个分类器在潜在空间中被训练以产生线性可分的决策边界,确保每个概念组沿独立的基向量进行编码。
- 损失函数结合VAE的重建损失与辅助分类器的交叉熵损失,以鼓励解耦与概念特定的表征。
- 训练完成后,使用每个标签类别的估计1D正态分布及未知类别的中间分布,进行1-NN分类。
- 通过建模不确定性,该方法支持开放世界识别:当潜在激活落在已知类别分布之外时,检测未知实例。
- 该方法在合成数据(带颜色的dSprites)与来自人类示范的真实世界物体数据集上进行了评估,概念组由人工标注的符号定义。
实验结果
研究问题
- RQ1深度生成模型能否学习到一个解耦且可解释的潜在空间,使得每个变化因子(如颜色、大小)被编码在独立且正交的潜在维度上?
- RQ2此类表征能否支持已知概念的鲁棒1-NN分类,同时检测未知概念(开放世界识别)?
- RQ3与无监督基线模型(如β-VAE)相比,该方法在概念对齐与未见数据泛化能力方面表现如何?
- RQ4该框架能否在仅使用弱标签化人类示范的情况下,泛化至真实世界的机器人操作任务?
- RQ5在潜在空间中强制不同概念组之间的正交性,是否能提升可解释性与下游推理性能?
主要发现
- 完整模型在学习到的基向量与语义概念之间实现了高余弦相似度(如红色为0.98,小尺寸为0.93),表明轴对齐效果良好。
- 仅使用分类器的基线在已知类别分类上表现相当,但无法检测未知实例,dSprites数据集上未知类别的F1分数分别降至0.29(α=0)与0.23(γ=0)。
- β-VAE基线未能保持轴对齐,颜色与大小等概念分散在多个潜在维度中,导致可解释性差。
- 在真实世界数据上,完整模型在蓝色、红色与未知类别上的F1分数分别达到0.87、0.86与0.95,表明在已知与未知实例上均表现优异。
- 当α=1且γ≠0时,模型在已知与未知检测之间达到最佳平衡,dSprites上蓝色、红色与未知类别的F1分数分别为0.88、0.98与0.87。
- 该框架成功实现了基于每类1D正态分布及未知类中间分布的1-NN分类,支持开放世界推理。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。