Skip to main content
QUICK REVIEW

[论文解读] PIC: Permutation Invariant Convolution for Recognizing Long-range Activities

Noureldien Hussein, Efstratios Gavves|arXiv (Cornell University)|Mar 18, 2020
Human Pose and Action Recognition被引用 9
一句话总结

该论文提出PIC(排列不变卷积),一种新型神经层,通过在其感受野内对时间顺序保持不变,尊重局部连接以实现分层抽象,并使用共享权重来检测长视频中嘈杂环境下的判别性视觉线索,从而建模长程视频活动。PIC在Charades、Breakfast和MultiThumos数据集上均达到最先进性能,显著优于采用自注意力、Timeception和向量聚合的3D卷积网络。

ABSTRACT

Neural operations as convolutions, self-attention, and vector aggregation are the go-to choices for recognizing short-range actions. However, they have three limitations in modeling long-range activities. This paper presents PIC, Permutation Invariant Convolution, a novel neural layer to model the temporal structure of long-range activities. It has three desirable properties. i. Unlike standard convolution, PIC is invariant to the temporal permutations of features within its receptive field, qualifying it to model the weak temporal structures. ii. Different from vector aggregation, PIC respects local connectivity, enabling it to learn long-range temporal abstractions using cascaded layers. iii. In contrast to self-attention, PIC uses shared weights, making it more capable of detecting the most discriminant visual evidence across long and noisy videos. We study the three properties of PIC and demonstrate its effectiveness in recognizing the long-range activities of Charades, Breakfast, and MultiThumos.

研究动机与目标

  • 为解决标准卷积、自注意力和向量聚合在建模具有混乱、非严格时间顺序的长程人类活动时的局限性。
  • 设计一种神经层,使其对感受野内特征的排列顺序保持不变,从而能够建模弱有序的长程时间结构。
  • 保持局部连接性,使级联层能够学习长程活动的深层分层抽象。
  • 使用共享权重(键-值卷积核)以增强在长且嘈杂的视频序列中对显著视觉证据的检测能力。
  • 证明PIC可使现有3D CNN有效识别多个基准数据集上的长程活动。

提出的方法

  • PIC引入一种排列不变卷积操作,计算局部时间窗口内特征的固定、与顺序无关的表示。
  • 在感受野的所有位置上共享键和值卷积核,从而实现参数效率并增强对噪声输入的鲁棒性。
  • 该层在特征窗口上应用可学习的聚合函数,使其对输入特征的顺序保持不变。
  • PIC通过在滑动时间窗口上应用相同操作,保持局部连接性,从而通过堆叠层实现分层特征学习。
  • 该架构被集成到3D CNN主干网络中,并在长程视频数据集上端到端训练以进行动作识别。
  • 多个PIC层的级联可实现多层次抽象:浅层学习细粒度单元动作,深层学习片段级交互。

实验结果

研究问题

  • RQ1能否设计一种神经层,使其对感受野内特征的时间排列保持不变,同时仍保留用于分层学习的局部连接性?
  • RQ2在时间建模层中使用共享权重,与非共享注意力机制相比,如何提升在长且嘈杂视频中对判别性视觉证据的检测能力?
  • RQ3与标准3D卷积、自注意力和向量聚合相比,PIC在多大程度上能提升长程动作识别性能?
  • RQ4PIC是否能更好地建模如“准备咖啡”或“制作煎堆”等弱有序、长时间持续的活动?
  • RQ5PIC能否在视频长度、标注复杂度和动作构成各不相同的多样化数据集上实现良好泛化?

主要发现

  • 在Breakfast数据集上,PIC达到89.84%的准确率,显著优于Timeception(86.93%)和Nonlocal(83.79%),证明其在建模长程、多单元活动方面的优越性能。
  • 在Charades数据集上,采用ResNet-101主干网络的PIC达到43.8% mAP,超越此前最先进方法42.5%(SlowFast-NL),在多标签、复杂动作上表现强劲。
  • 在MultiThumos数据集上,PIC达到78.31% mAP,优于Timeception(74.79%)和基础3D CNN(72.43%),证实其在长时、多标签视频序列中的有效性。
  • 可视化结果表明,早期PIC层学习到如“倒出”或“切割”等与动作无关的细粒度概念,而深层则学习更高阶、与活动相关的交互。
  • 消融研究证实,PIC的三个特性——排列不变性、局部连接性和共享权重——对性能均至关重要,且各自对鲁棒性和准确率有独特贡献。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。