Skip to main content
QUICK REVIEW

[论文解读] Unseen Action Recognition with Multimodal Learning

AJ Piergiovanni, Michael S. Ryoo|arXiv (Cornell University)|Jun 21, 2018
Multimodal Machine Learning Applications参考文献 2被引用 3
一句话总结

本文提出了一种多模态学习框架,通过对抗性训练策略联合嵌入文本和视频数据到共享表征空间,同时利用成对和非成对数据。该方法通过学习对未见动作更具鲁棒性和泛化能力的表征,在零样本动作分类、无监督活动发现和未见活动字幕生成任务中达到最先进性能。

ABSTRACT

We present a method to learn a joint multimodal representation space that enables recognition of unseen activities in videos. We first compare the effect of placing various constraints on the embedding space using paired text and video data. We also propose a method to improve the joint embedding space using an adversarial formulation, allowing it to benefit from unpaired text and video data. By using unpaired text data, we show the ability to learn a representation that better captures unseen activities. In addition to testing on publicly available datasets, we introduce a new, large-scale text/video dataset. We experimentally confirm that using paired and unpaired data to learn a shared embedding space benefits three difficult tasks (i) zero-shot activity classification, (ii) unsupervised activity discovery, and (iii) unseen activity captioning, outperforming the state-of-the-arts.

研究动机与目标

  • 为解决通过从文本和视频中学习联合多模态表征来识别视频中未见动作的挑战。
  • 通过将非成对的文本和视频数据引入学习过程,提升对未见活动的泛化能力。
  • 开发一种方法,同时利用成对和非成对数据,以增强零样本和无监督学习任务的表征学习性能。
  • 引入一个新的大规模文本/视频数据集,用于在真实条件下评估未见动作识别。
  • 在零样本活动分类、无监督活动发现和未见活动字幕生成任务中超越现有方法。

提出的方法

  • 该方法使用成对数据学习文本和视频的联合嵌入空间,并在嵌入空间上施加约束以改善对齐。
  • 引入对抗性公式以对齐非成对文本和视频嵌入的边缘分布,从而实现从未成对数据中迁移知识。
  • 对抗性训练组件促使模型学习一种能更好地泛化到未见动作的共享表征。
  • 模型通过成对数据上的对比学习目标和非成对数据上的域对抗对齐进行端到端训练。
  • 该框架在公开基准和新引入的大规模文本/视频数据集上进行评估。
  • 该方法采用共享编码器架构,并辅以模态特定的头模块,用于联合表征学习。

实验结果

研究问题

  • RQ1对抗性公式能否有效对齐非成对的文本和视频数据,从而改善未见动作的表征学习?
  • RQ2结合成对和非成对数据对零样本动作分类性能有何影响?
  • RQ3联合嵌入空间在多大程度上提升了无监督活动发现和未见活动字幕生成性能?
  • RQ4与先前的最先进方法相比,该方法在泛化到未见动作方面是否表现更优?
  • RQ5非成对数据在学习捕捉新活动的表征中起到了何种贡献?

主要发现

  • 通过同时利用成对和非成对数据,该方法在零样本动作分类任务中达到最先进性能。
  • 使用非成对文本数据显著提升了模型在联合嵌入空间中泛化到未见动作的能力。
  • 对抗性训练组件有效对齐了文本和视频特征的边缘分布,从而提升了表征质量。
  • 该模型在无监督活动发现任务中优于现有方法,表现出对新动作更好的聚类能力。
  • 所提出的方法在未见活动字幕生成任务中取得更优结果,生成的描述更准确且相关性更高。
  • 新引入的大规模文本/视频数据集使得在真实、多样的条件下对未见动作识别进行更稳健的评估成为可能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。