Skip to main content
QUICK REVIEW

[论文解读] Policy learning with partial observation and mechanical constraints for multi-person modeling

Keisuke Fujii, Naoya Takeishi|arXiv (Cornell University)|Jul 7, 2020
Reinforcement Learning in Robotics参考文献 60被引用 8
一句话总结

本文提出了一种去中心化的多智能体模仿学习框架,将部分观测和机械约束整合到序列生成模型中,用于生物上合理的多人行为建模。通过结合Gumbel-Softmax重参数化与分层变分RNN,该方法实现了可解释的动作生成,并可视化了智能体特定的信息使用情况,在篮球和足球运动数据集上实现了更优的行为合理性。

ABSTRACT

Extracting the rules of real-world biological multi-agent behaviors is a current challenge in various scientific and engineering fields. Biological agents generally have limited observation and mechanical constraints; however, most of the conventional data-driven models ignore such assumptions, resulting in lack of biological plausibility and model interpretability for behavioral analyses in biological and cognitive science. Here we propose sequential generative models with partial observation and mechanical constraints, which can visualize whose information the agents utilize and can generate biologically plausible actions. We formulate this as a decentralized multi-agent imitation learning problem, leveraging binary partial observation models with a Gumbel-Softmax reparameterization and policy models based on hierarchical variational recurrent neural networks with physical and biomechanical constraints. We investigate the empirical performances using real-world multi-person motion datasets from basketball and soccer games.

研究动机与目标

  • 解决传统数据驱动多智能体模型中生物合理性与可解释性不足的问题。
  • 在观测受限和机械约束条件下建模现实世界中的多智能体行为,反映生物与认知系统的特点。
  • 开发一种去中心化的模仿学习方法,以捕捉智能体在决策过程中使用的信息。
  • 生成在物理和生物力学上合理且与观测行为一致的动作。
  • 通过可视化多人群体互动中智能体特定的信息利用情况,提升模型可解释性。

提出的方法

  • 将问题表述为在部分观测和机械约束下的去中心化多智能体模仿学习。
  • 采用带有Gumbel-Softmax重参数化的二元部分观测模型,以建模智能体特定的信息访问方式。
  • 利用分层变分循环神经网络(HVRNNs)学习结构化且时间一致的策略。
  • 将物理与生物力学约束整合到策略网络中,以确保生成动作的逼真性。
  • 集成一种序列生成建模框架,以观测轨迹和潜在变量为条件。
  • 通过注意力机制与潜在空间分析,实现对智能体信息利用情况的可视化。

实验结果

研究问题

  • RQ1如何在多智能体模仿学习中有效建模部分观测,以反映现实世界中智能体的限制?
  • RQ2机械与物理约束在多大程度上提升了生成行为的生物合理性?
  • RQ3该模型能否识别并可视化每个智能体在决策过程中使用的信息源?
  • RQ4分层变分RNN的整合在观测与约束限制下如何增强策略学习?
  • RQ5所提方法在真实世界体育运动数据集上生成真实、可解释的多人行为的性能如何?

主要发现

  • 通过在策略学习过程中施加机械与物理约束,模型成功生成了生物上合理的动作。
  • 采用Gumbel-Softmax重参数化有效实现了对部分观测的建模,并通过离散注意力机制实现对信息源的关注。
  • 分层变分RNN提升了多智能体场景下时间一致性与策略泛化能力。
  • 该框架实现了对智能体特定信息利用情况的可视化,显著增强了模型可解释性。
  • 在篮球与足球数据集上的实证结果表明,与无约束基线模型相比,本方法在行为合理性方面表现更优。
  • 模型在观测受限与物理约束条件下,仍能稳健生成逼真的多人交互行为。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。