Skip to main content
QUICK REVIEW

[论文解读] MGpi: A Computational Model of Multiagent Group Perception and Interaction

Navyata Sanghvi, Ryo Yonetani|arXiv (Cornell University)|Mar 4, 2019
Human Pose and Action Recognition被引用 5
一句话总结

MGpi 是一种深度学习模型,通过基于运动学-距离-信息(KPM)门机制建模群体感知与交互,实现多智能体社会智能。该门机制利用身体动作与空间接近度,实现无监督的社会信号门控。该模型在无需显式群体标注、布局假设或手工调参的情况下,实现了最先进(SOTA)的群体识别性能,通过模仿人类交互示范学习社会注意力机制。

ABSTRACT

Toward enabling next-generation robots capable of socially intelligent interaction with humans, we present a $\\mathbf{computational\\; model}$ of interactions in a social environment of multiple agents and multiple groups. The Multiagent Group Perception and Interaction (MGpi) network is a deep neural network that predicts the appropriate social action to execute in a group conversation (e.g., speak, listen, respond, leave), taking into account neighbors' observable features (e.g., location of people, gaze orientation, distraction, etc.). A central component of MGpi is the Kinesic-Proxemic-Message (KPM) gate, that performs social signal gating to extract important information from a group conversation. In particular, KPM gate filters incoming social cues from nearby agents by observing their body gestures (kinesics) and spatial behavior (proxemics). The MGpi network and its KPM gate are learned via imitation learning, using demonstrations from our designed $\\mathbf{social\\; interaction\\; simulator}$. Further, we demonstrate the efficacy of the KPM gate as a social attention mechanism, achieving state-of-the-art performance on the task of $\\mathbf{group\\; identification}$ without using explicit group annotations, layout assumptions, or manually chosen parameters.

研究动机与目标

  • 开发一种多智能体群体感知与交互的计算模型,实现在动态多群体环境中的社会智能机器人行为。
  • 通过基于运动学与距离学的可学习注意力机制,解决社会信号门控问题——从附近智能体中筛选相关线索。
  • 在不依赖显式群体标注、空间布局假设(如F型队形)或手工调参的情况下,实现群体识别。
  • 通过自定义社交互动模拟器提供的示范,端到端地进行模仿学习训练,以模拟人类对话动态。
  • 证明社会感知(特别是群体检测)可自然地从训练社会适当动作选择中涌现。

提出的方法

  • MGpi 是一种深度神经网络,包含三个核心模块:使用KPM门的社会信号门控模块、用于历史交互的短期记忆(STM)编码器,以及用于动作预测的交互策略模块。
  • KPM门通过整合邻近智能体的运动学(身体动作)、距离学(空间距离)和语言(信息)线索,确定其影响力,实现社会信号门控。
  • KPM门采用池化操作处理动态数量的邻居,支持无监督、数据驱动的群体聚类。
  • 模型通过模仿学习进行训练,使用来自自定义社交互动模拟器的示范,群体形成无显式监督。
  • KPM门作为可学习的社会注意力机制,在策略训练过程中隐式学习基于行为模式的群体识别。
  • 该架构支持去中心化决策,每个智能体根据感知到的社会信号和短期记忆,选择动作(如说话、倾听、回应、离开)。

实验结果

研究问题

  • RQ1在多智能体对话中,通过训练实现社会适当动作选择的深度学习模型,是否能隐式学习到群体识别,而无需显式群体标注?
  • RQ2KPM门作为社会注意力机制,在密集的多群体环境中,过滤相关社会信号的有效性如何?
  • RQ3基于数据驱动的无监督群体检测方法,是否优于依赖启发式布局假设(如F型队形)或手工调参的方法?
  • RQ4模仿学习对话行为在多大程度上能导致社会感知(如群体识别)的涌现?
  • RQ5KPM门是否能在无需布局特定调优或先验空间知识的情况下,泛化到多样化的真实世界数据集?

主要发现

  • KPM门在三个数据集(合成数据、咖啡休息、鸡尾酒会)上的群体识别任务中均达到最先进性能,且未使用显式群体标注或布局假设。
  • 在合成数据集上,MGpi 在所有指标上显著优于所有SOTA方法,展现出强大的泛化能力与鲁棒性。
  • 在咖啡休息数据集上,MGpi 达到最高精确率(Precision),F1分数与最佳方法GCFF持平,表明精确率与召回率之间具有优异平衡。
  • 在鸡尾酒会数据集上,MGpi 的F1分数略低于GCFF和GRUPO,但优于HVFF-ms,且在召回率(Recall)方面表现相当,同时在精确率方面优于所有其他方法。
  • KPM门的训练过程高度稳定,各次运行的标准差极低,推理速度极快(数毫秒),支持实时部署。
  • 该模型表明,群体检测可自然地从社会交互策略训练中涌现,无需对群体形成施加任何显式监督,凸显了模仿学习在社会智能中的强大潜力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。