Skip to main content
QUICK REVIEW

[论文解读] Inferring Personalized Bayesian Embeddings for Learning from Heterogeneous Demonstration

Rohan Paleja, Matthew Gombolay|arXiv (Cornell University)|Mar 14, 2019
Reinforcement Learning in Robotics被引用 4
一句话总结

该论文提出了一种贝叶斯LfD框架,通过贝叶斯神经网络(BNNs)为异质人类示范者推断个性化嵌入,实现准确的个性化行为预测。通过引入成对动作比较的反事实推理,该方法提升了数据效率,并在合成数据集和真实世界StarCraft II数据集上优于最先进基线方法。

ABSTRACT

For assistive robots and virtual agents to achieve ubiquity, machines will need to anticipate the needs of their human counterparts. The field of Learning from Demonstration (LfD) has sought to enable machines to infer predictive models of human behavior for autonomous robot control. However, humans exhibit heterogeneity in decision-making, which traditional LfD approaches fail to capture. To overcome this challenge, we propose a Bayesian LfD framework to infer an integrated representation of all human task demonstrators by inferring human-specific embeddings, thereby distilling their unique characteristics. We validate our approach is able to outperform state-of-the-art techniques on both synthetic and real-world data sets.

研究动机与目标

  • 解决在学习从示范(LfD)中人类行为异质性带来的挑战,其中传统方法假设行为同质性,或使用聚类方法,导致数据效率降低。
  • 克服先前基于聚类的LfD方法的局限性,这些方法牺牲了模型容量,且无法有效处理混合或簇内变异性。
  • 开发一种贝叶斯神经网络框架,推断个体特定的嵌入,同时利用示范者之间的共享结构。
  • 通过引入成对动作比较的反事实推理,提升低数据场景下的数据效率。
  • 提出一种混合训练策略(Hybrid-Bayes Shift),以确保在贝叶斯嵌入收敛之前实现早期推理的稳健性能。

提出的方法

  • 利用贝叶斯神经网络(BNNs)学习表示个体人类决策特征的潜在嵌入,实现个性化行为建模。
  • 通过比较每个状态下人类实际采取的动作与其他所有可能动作,整合反事实推理,有效增强训练信号。
  • 将学习目标表述为最大化观测动作的可能性,同时对未观测动作施加惩罚,采用概率排名损失。
  • 采用混合训练策略(Hybrid-Bayes Shift),将非贝叶斯初始模型与渐进式贝叶斯微调相结合,以稳定早期预测。
  • 通过反向传播通过贝叶斯层端到端训练BNN以推断嵌入,实现对个体示范者的不确定性感知自适应。
  • 将该框架应用于合成作业车间调度和真实人类在StarCraft II中的游戏行为,以动作描述符和状态特征作为输入。

实验结果

研究问题

  • RQ1贝叶斯神经网络能否有效用于推断捕捉异质LfD中个体决策模式的个性化嵌入?
  • RQ2通过成对动作比较的反事实推理在低数据LfD设置中在多大程度上提升了数据效率和模型性能?
  • RQ3混合训练策略(Hybrid-Bayes Shift)能否在贝叶斯嵌入随时间收敛的同时实现稳健的早期性能?
  • RQ4贝叶斯嵌入在不同神经网络架构之间(如从动作预测网络到价值预测网络)是否可迁移?
  • RQ5所提出方法在预测准确性和泛化能力方面是否优于最先进基于聚类的LfD方法?

主要发现

  • 所提出的带有个性化嵌入的贝叶斯LfD框架在合成数据集和真实世界数据集上均显著优于先前最先进方法,包括基于k-means聚类的基线方法。
  • 通过成对比较的反事实推理显著提升了性能,尤其在低数据场景下,通过有效增强有效训练信号实现了数倍的性能提升。
  • Hybrid-Bayes Shift算法通过在初始训练阶段利用非贝叶斯模型,实现了强大的早期性能,随后过渡到完整的贝叶斯推理。
  • 在StarCraft II上的实证结果表明,即使训练数据有限,模型也能以高精度准确预测人类行为。
  • 研究发现,贝叶斯嵌入在不同网络架构之间(例如从动作网络到价值网络)并非可靠可迁移,表明若无显式设计,网络无关嵌入并非必然成立。
  • 结果表明,BNNs在异质场景下的LfD中表现良好,能够提供不确定性估计,并改善对个体人类行为的适应能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。