Skip to main content
QUICK REVIEW

[论文解读] Motion Question Answering via Modular Motion Programs

Mark Endo, Joy Hsu|arXiv (Cornell University)|May 15, 2023
Multimodal Machine Learning Applications被引用 5
一句话总结

本文提出了HumanMotionQA,一个用于评估复杂、多步骤时空推理能力的人体运动序列新基准,并提出NSPose方法,该方法采用模块化运动程序的神经符号方法,在无需动作边界监督的情况下,对运动概念、属性和时序关系进行定位。NSPose通过符号程序执行和模块化学习,优于端到端基线模型,在BABEL-QA数据集上实现了最先进性能,提升了时序定位能力并减少了数据偏差。

ABSTRACT

In order to build artificial intelligence systems that can perceive and reason with human behavior in the real world, we must first design models that conduct complex spatio-temporal reasoning over motion sequences. Moving towards this goal, we propose the HumanMotionQA task to evaluate complex, multi-step reasoning abilities of models on long-form human motion sequences. We generate a dataset of question-answer pairs that require detecting motor cues in small portions of motion sequences, reasoning temporally about when events occur, and querying specific motion attributes. In addition, we propose NSPose, a neuro-symbolic method for this task that uses symbolic reasoning and a modular design to ground motion through learning motion concepts, attribute neural operators, and temporal relations. We demonstrate the suitability of NSPose for the HumanMotionQA task, outperforming all baseline methods.

研究动机与目标

  • 为真实场景中长时序人体运动序列的复杂、多步骤推理缺乏基准的问题提供解决方案。
  • 开发一种无需依赖动作边界标注即可实现对未修剪运动序列进行细粒度时序推理的方法。
  • 通过神经符号框架学习模块化运动概念与时序关系,减轻运动理解中的数据偏差。
  • 利用符号程序执行,实现对运动属性(如动作、方向、身体部位)在时间上的忠实定位。
  • 证明模块化、基于程序的推理相比端到端模型,能提升泛化能力和运动问答准确率。

提出的方法

  • 提出一种神经符号框架NSPose,将问题分解为递归符号程序,并在运动序列上执行。
  • 使用重叠运动片段(f帧,o重叠)以保留时序上下文,同时在无动作边界的情况下实现细粒度推理。
  • 通过问题-答案对的端到端训练,联合学习运动表征与语言概念嵌入。
  • 采用一维卷积层(带膨胀或线性层)作为时序算子,以建模如“之前”、“之后”、“之间”等关系。
  • 引入模块化设计,使每个程序组件对应特定的运动概念(如“行走”、“左臂”)或关系类型。
  • 采用弱监督训练设置,避免依赖真实动作边界,从而减少数据偏差。

实验结果

研究问题

  • RQ1神经符号方法是否能在未修剪人体运动序列中实现优于端到端模型的时序定位?
  • RQ2模块化程序学习在多大程度上能提升对细粒度运动属性(如身体部位、方向)和时序关系的推理能力?
  • RQ3消除对动作边界标注的依赖是否能提升运动问答中的泛化能力和鲁棒性?
  • RQ4在性能和上下文保留方面,重叠运动分割与非重叠或基于真实边界分割相比如何?
  • RQ5简单的时序算子(如线性与膨胀卷积)是否能达到与更复杂架构相当的性能?

主要发现

  • NSPose在BABEL-QA测试集上达到0.578的整体准确率,优于所有端到端基线方法。
  • 重叠片段策略(f=16, o=8)相比非重叠片段提升0.038的性能,证明了上下文保留的优势。
  • NSPose的弱监督方法在整体准确率上比使用真实动作边界变体高出0.025,表明其在无监督条件下具有更优的泛化能力。
  • 一维卷积时序算子达到0.578的性能,与线性算子(0.540)相当,表明简单函数足以实现有效的时序推理。
  • NSPose在动作查询任务上达到0.627的准确率,在方向查询上达到0.598,表明其在复杂、多步骤推理任务中表现优异。
  • 模型在未见的运动概念组合上泛化良好,表现为在多样化问题类型上保持一致性能,未表现出对数据偏差的利用。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。