[论文解读] Hierarchical Compositional Representations for Few-shot Action Recognition
本文提出了一种分层组合表示(HCR)框架用于少样本动作识别,将动作分解为子动作和空间注意力子动作(SAS-action),以捕捉细粒度且可迁移的模式。通过使用地球移动距离(EMD)比较子动作序列,该方法在HMDB51、UCF101和Kinetics数据集上实现了最先进性能,在5-way 1-shot设置下的准确率分别为67.5%、88.9%和75.7%。
Recently action recognition has received more and more attention for its comprehensive and practical applications in intelligent surveillance and human-computer interaction. However, few-shot action recognition has not been well explored and remains challenging because of data scarcity. In this paper, we propose a novel hierarchical compositional representations (HCR) learning approach for few-shot action recognition. Specifically, we divide a complicated action into several sub-actions by carefully designed hierarchical clustering and further decompose the sub-actions into more fine-grained spatially attentional sub-actions (SAS-actions). Although there exist large differences between base classes and novel classes, they can share similar patterns in sub-actions or SAS-actions. Furthermore, we adopt the Earth Mover's Distance in the transportation problem to measure the similarity between video samples in terms of sub-action representations. It computes the optimal matching flows between sub-actions as distance metric, which is favorable for comparing fine-grained patterns. Extensive experiments show our method achieves the state-of-the-art results on HMDB51, UCF101 and Kinetics datasets.
研究动机与目标
- 解决因数据稀缺和复杂时间动态性带来的少样本动作识别挑战。
- 克服现有方法中全局视频池化和刚性片段对齐的局限性。
- 通过发现共享的细粒度模式,实现从基础类别到新类别的判别性知识迁移。
- 提出一种将动作分层分解为子动作和空间注意力子动作(SAS-action)的方法,以提升表征学习效果。
- 引入地球移动距离(EMD)作为鲁棒度量,用于跨视频样本比较细粒度子动作序列。
提出的方法
- 应用分层聚类将复杂动作分解为时间一致的子动作。
- 设计部件注意力模块(PAM)以提取空间注意力子动作(SAS-action),区分显式(身体部位)和隐式(上下文线索)成分。
- 使用部件先验约束引导注意力聚焦于预定义的身体部位,提升相关运动模式的定位能力。
- 将每段视频表示为子动作和SAS-action嵌入序列,以实现细粒度比较。
- 采用地球移动距离(EMD)计算子动作序列之间的最优传输流,实现鲁棒的相似性度量。
- 使用度量学习目标进行模型训练,以最小化EMD空间中的类内距离并最大化类间距离。
实验结果
研究问题
- RQ1将动作分层分解为子动作和SAS-action是否能通过捕捉可迁移的细粒度模式,提升少样本动作识别性能?
- RQ2在少样本动作识别中,地球移动距离(EMD)是否优于传统的余弦或欧氏距离度量来比较视频表征?
- RQ3通过注意力机制学习到的显式和隐式SAS-action是否能有效建模身体部位和上下文线索,从而提升泛化能力?
- RQ4子动作的数量如何影响识别性能?粒度与冗余之间的最优权衡是什么?
- RQ5在大规模视频数据集(如IG-65M)上进行预训练,在低数据场景下在多大程度上能提升少样本泛化能力?
主要发现
- 所提出的HCR方法在HMDB51的5-way 1-shot设置下实现了67.5%的最先进准确率。
- 在UCF101上,该方法在5-way 1-shot基准中达到88.9%的准确率,优于先前方法。
- 在Kinetics上,模型在5-way 1-shot设置下实现75.7%的准确率,展现出在多样化动作类别上的强大泛化能力。
- HMDB51的最优子动作数量为12,UCF101为16,Kinetics为24,表明不同数据集在粒度上的权衡存在差异。
- 地球移动距离(EMD)在度量视频表征相似性方面显著优于欧氏距离和余弦距离。
- 平均池化(AvgPool)的性能优于最大池化(MaxPool),表明保留较少判别性的特征有助于提升少样本泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。