[论文解读] Temporal Gaussian Mixture Layer for Videos
本文提出时间高斯混合(TGM)层,一种可微分、参数高效的卷积层,通过高斯核的混合来建模视频中的长程时间依赖,实现对扩展时间上下文的有效捕捉,而无需增加模型参数。该方法在Charades和MultiTHUMOS数据集上达到最先进性能,在原始Charades定位设置下,mAP相比I3D和先前方法最高提升22.3%。
We introduce a new convolutional layer named the Temporal Gaussian Mixture (TGM) layer and present how it can be used to efficiently capture longer-term temporal information in continuous activity videos. The TGM layer is a temporal convolutional layer governed by a much smaller set of parameters (e.g., location/variance of Gaussians) that are fully differentiable. We present our fully convolutional video models with multiple TGM layers for activity detection. The extensive experiments on multiple datasets, including Charades and MultiTHUMOS, confirm the effectiveness of TGM layers, significantly outperforming the state-of-the-arts.
研究动机与目标
- 为解决在连续视频动作检测中建模长期时间依赖的挑战。
- 在保持或提升长程时间建模性能的同时,减少时间卷积层中的可学习参数数量。
- 实现完全卷积的视频模型,通过可微分、参数化的注意力机制,高效关注时间上相距较远的帧。
- 通过捕捉更丰富、更抽象的时空表征,提升在Charades和MultiTHUMOS等动作检测基准上的性能。
提出的方法
- TGM层将时间卷积滤波器构建为M个高斯分布的软性混合,每个高斯分布由位置(均值)和方差定义,且混合权重可学习。
- 该层将基于高斯的滤波器应用于时间特征图,使模型能够同时关注多个非局部的时间区域。
- TGM层的参数数量与滤波器长度L无关,从而在不引发参数爆炸的情况下实现长程时间建模。
- TGM层完全可微分,可通过反向传播进行训练,支持与标准CNN端到端联合训练。
- 该方法被集成到一个堆叠在I3D特征之上的全卷积视频模型中,多个TGM层实现时间结构的分层建模。
- 模型使用软性注意力机制将多个高斯核合并为单个有效滤波器,实现对相关时间区间的动态聚焦。
实验结果
研究问题
- RQ1一个参数高效的时序卷积层能否捕捉连续视频动作检测中的长程时间依赖?
- RQ2TGM层的参数数量与滤波器长度L无关,这一特性如何影响其在长时活动上的性能表现?
- RQ3高斯混合机制是否能比固定大小的一维卷积或池化层实现更好的时间建模?
- RQ4TGM层能否在基准数据集上超越SOTA方法(如I3D、LSTM和时间金字塔池化)?
- RQ5该模型如何适应平均活动时长不同的数据集,例如Charades(更长)与MultiTHUMOS(更短)?
主要发现
- 在原始定位设置下,TGM模型在Charades数据集上达到22.3%的mAP,超越此前SOTA方法(使用I3D与超事件的19.4%)。
- 当L=30且使用三个TGM层时,模型可捕捉约800帧(±15秒)的时间上下文,显著超过I3D的±2秒。
- 在MultiTHUMOS上,当L=5且使用三个TGM层时,模型达到37.2%的mAP,优于标准一维卷积和其他基线方法。
- 由于高斯注意力机制的存在,TGM层在大L值下仍保持性能稳定,该机制能自然地将关注焦点限制在相关的时间区域,即使滤波器长度很长。
- 当使用三个TGM层且L=30时,模型在MultiTHUMOS上达到33.9%的mAP,优于单个TGM层和所有L值下的1D卷积。
- 可视化结果表明,TGM层学会聚焦于时间区间的中心位置,Charades中高斯分布更宽(对应更长活动),而MultiTHUMOS中则更窄(对应更短事件)。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。