Skip to main content
QUICK REVIEW

[论文解读] Interactive Fusion of Multi-level Features for Compositional Activity Recognition

Rui Yan, Lingxi Xie|arXiv (Cornell University)|Dec 10, 2020
Human Pose and Action Recognition参考文献 35被引用 9
一句话总结

该论文提出了一种交互式融合框架,通过跨模态投影和辅助时序预测任务,整合位置、外观和语义等多层次特征,实现组合动作识别。该方法在Something-Else数据集上相比最先进模型实现了2.9%的top-1准确率提升,证明了其在组合推理中具备更优的泛化能力和鲁棒性。

ABSTRACT

To understand a complex action, multiple sources of information, including appearance, positional, and semantic features, need to be integrated. However, these features are difficult to be fused since they often differ significantly in modality and dimensionality. In this paper, we present a novel framework that accomplishes this goal by interactive fusion, namely, projecting features across different spaces and guiding it using an auxiliary prediction task. Specifically, we implement the framework in three steps, namely, positional-to-appearance feature extraction, semantic feature interaction, and semantic-to-positional prediction. We evaluate our approach on two action recognition datasets, Something-Something and Charades. Interactive fusion achieves consistent accuracy gain beyond off-the-shelf action recognition algorithms. In particular, on Something-Else, the compositional setting of Something-Something, interactive fusion reports a remarkable gain of 2.9% in terms of top-1 accuracy.

研究动机与目标

  • 解决在组合动作识别中融合多层级特征(外观、位置和语义)的挑战,这些特征在模态和维度上存在显著差异。
  • 克服晚期融合方法的局限性,后者无法建模异质特征之间的交互,导致泛化能力差和偏差问题。
  • 通过交互式特征融合实现组合推理,使模型能够泛化到训练过程中未见的物体与动作的新组合。
  • 通过引入实例之间的空间和时间关系,减少对基于外观的归纳偏置的依赖。
  • 通过增强特征交互和表征学习,提升少样本和零样本组合设置下的性能。

提出的方法

  • 通过构建以实例为中心的表征(利用轨迹片段)并将其与非外观特征结合,实现从位置到外观的特征提取,生成联合表征。
  • 通过在潜在空间中建模联合表征之间的类别感知成对关系,实现语义特征交互,生成语义特征。
  • 将语义到位置的预测作为辅助任务,模型通过预测未来实例的位置和偏移量来引导特征融合。
  • 使用可学习的投影头将语义特征映射回位置空间,实现跨模态交互与对齐。
  • 通过加权组合主识别损失和辅助预测损失来优化整体目标,其中超参数λ平衡两者的贡献。
  • 端到端集成强骨干网络(如I3D)和关系模块(如STIN、NL),以增强特征学习。

实验结果

研究问题

  • RQ1交互式融合多层级特征是否能在组合动作识别中超越传统的晚期融合或早期拼接方法?
  • RQ2对未来的实例状态进行辅助预测在多模态动作识别中如何增强特征交互与表征学习?
  • RQ3所提框架在未见的物体与动作组合上的泛化能力达到何种程度?
  • RQ4交互式融合是否能降低对基于外观的归纳偏置的依赖,特别是在外观模糊的情况下?
  • RQ5与标准端到端模型相比,该模型在少样本或零样本设置下的表现如何?

主要发现

  • 所提出的交互式融合框架在Something-Else数据集上相比[20]中的端到端模型,实现了2.9%的top-1准确率绝对提升,以及3.3%的top-5准确率提升。
  • 在细粒度的Charades数据集上,该方法相比I3D + STIN实现了6.8%的mAP提升,而在完整Ours-SFI设置下mAP达到25.2%,优于近期的关系建模方法。
  • 模型在少样本设置下表现出强大的泛化能力,表明交互式融合有助于缓解过拟合并提升鲁棒性。
  • 类别级分析显示,该方法在涉及相对运动和物体属性的复杂动作(如“将某物从某物中倒出”和“使某物旋转以持续旋转”)上显著优于基线方法。
  • 可视化结果表明,该模型避免了晚期融合方法常见的外观或位置偏差,例如不会因容器的存在而误分类动作,也不会忽略细微的自运动线索。
  • 消融研究证实,辅助预测任务可稳定训练并提升性能,最优λ值为5;而简单的晚期融合在部分特征无信息时反而会损害性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。