Skip to main content
QUICK REVIEW

[论文解读] Multimodal Prototype-Enhanced Network for Few-Shot Action Recognition

Xinzhe Ni, Yong Liu|arXiv (Cornell University)|Dec 9, 2022
Human Pose and Action Recognition被引用 7
一句话总结

该论文提出多模态原型增强网络(MORN),一种少样本动作识别模型,通过基于CLIP的文本编码器和多模态原型增强(MPE)模块,利用标签文本中的语义信息来增强视觉原型。MORN在HMDB51、UCF101、Kinetics和SSv2数据集上实现了最先进性能,通过联合优化视觉和文本原型实现,且在训练过程中引入一种新型原型质量度量指标PRIDE后进一步提升了性能。

ABSTRACT

Current methods for few-shot action recognition mainly fall into the metric learning framework following ProtoNet, which demonstrates the importance of prototypes. Although they achieve relatively good performance, the effect of multimodal information is ignored, e.g. label texts. In this work, we propose a novel MultimOdal PRototype-ENhanced Network (MORN), which uses the semantic information of label texts as multimodal information to enhance prototypes. A CLIP visual encoder and a frozen CLIP text encoder are introduced to obtain features with good multimodal initialization. Then in the visual flow, visual prototypes are computed by a visual prototype-computed module. In the text flow, a semantic-enhanced (SE) module and an inflating operation are used to obtain text prototypes. The final multimodal prototypes are then computed by a multimodal prototype-enhanced (MPE) module. Besides, we define a PRototype SImilarity DiffErence (PRIDE) to evaluate the quality of prototypes, which is used to verify our improvement on the prototype level and effectiveness of MORN. We conduct extensive experiments on four popular few-shot action recognition datasets: HMDB51, UCF101, Kinetics and SSv2, and MORN achieves state-of-the-art results. When plugging PRIDE into the training stage, the performance can be further improved.

研究动机与目标

  • 为解决少样本动作识别中单模态原型的局限性,即有限标注数据导致原型表示不理想。
  • 利用标签文本中的语义信息作为互补模态,以提升原型质量和分类性能。
  • 设计一种简单而有效的框架,通过多模态融合增强原型,而非仅进行特征级融合。
  • 提出一种新度量指标——原型相似度差异(PRIDE),用于评估并指导训练过程中原型质量的改进。
  • 证明高质量原型对少样本动作识别至关重要,且多模态增强可显著提升性能。

提出的方法

  • 使用冻结的CLIP视觉编码器和冻结的CLIP文本编码器,以强零样本泛化能力初始化多模态特征。
  • 通过时间关系交叉变换器(TRX)模块计算视觉原型,以建模视频片段中的时间关系。
  • 应用语义增强(SE)模块,结合多头注意力机制,对标签文本的文本特征进行优化,随后执行扩展操作以对齐维度。
  • 通过多模态原型增强(MPE)模块,采用加权平均或基于注意力的融合方式,融合视觉和文本原型,生成最终的多模态原型。
  • 提出PRIDE度量指标,计算原型与其自身类别与其他类别平均值之间相似度的差异,用于评估原型质量。
  • 将PRIDE嵌入训练目标中,以进一步提升原型质量和模型性能。

实验结果

研究问题

  • RQ1在少样本动作识别中,将标签文本的语义信息融入是否能提升原型的代表性?
  • RQ2与单模态或特征级融合方法相比,多模态原型增强(融合视觉与文本原型)是否能带来更好的性能?
  • RQ3像PRIDE这样的专用度量指标能否有效评估并指导少样本学习中原型质量的改进?
  • RQ4使用PRIDE损失进行训练是否能在多个基准数据集上带来一致的性能提升?
  • RQ5设计选择如SE模块、MPE融合策略以及文本编码器冻结对最终性能有何影响?

主要发现

  • MORN在四个基准数据集上均达到最先进性能:HMDB51(86.3%)、UCF101(96.9%)、Kinetics(91.6%)和SSv2(71.1%),优于先前方法。
  • 在HMDB51、UCF101和Kinetics上,使用冻结的CLIP文本编码器配合语义增强(SE)模块显著提升性能,当两者同时使用时达到最佳结果。
  • 在SSv2上,MORN在使用冻结CLIP文本编码器且不使用SE模块的情况下达到72.8%准确率,表明SE模块在该数据集上作用较小。
  • 消融实验表明,在SE模块中使用多头注意力机制(4个头)以及超参数λ = 0.5时,HMDB51上性能最优。
  • 在HMDB51、UCF101和Kinetics上,MPE模块采用8头注意力机制表现最佳,而简单加权平均则以更少参数取得第二名性能。
  • 将PRIDE引入训练阶段可进一步提升性能,证实PRIDE能有效衡量并改善原型质量。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。