[论文解读] Deep Concept-wise Temporal Convolutional Networks for Action Localization
该论文提出概念级时间卷积网络(C-TCN),一种新型深度神经网络架构,通过用概念级时间卷积(CTC)层替代传统的时序卷积层,减少抽象特征概念的有害重组。通过为每个概念共享时序滤波器并支持多潜在学习,C-TCN在THUMOS’14上实现52.1%的mAP(相对提升21.7%),在ActivityNet上实现47.6%的mAP,优于先前方法且无需外部融合。
Existing action localization approaches adopt shallow temporal convolutional networks (\ie, TCN) on 1D feature map extracted from video frames. In this paper, we empirically find that stacking more conventional temporal convolution layers actually deteriorates action classification performance, possibly ascribing to that all channels of 1D feature map, which generally are highly abstract and can be regarded as latent concepts, are excessively recombined in temporal convolution. To address this issue, we introduce a novel concept-wise temporal convolution (CTC) layer as an alternative to conventional temporal convolution layer for training deeper action localization networks. Instead of recombining latent concepts, CTC layer deploys a number of temporal filters to each concept separately with shared filter parameters across concepts. Thus can capture common temporal patterns of different concepts and significantly enrich representation ability. Via stacking CTC layers, we proposed a deep concept-wise temporal convolutional network (C-TCN), which boosts the state-of-the-art action localization performance on THUMOS'14 from 42.8 to 52.1 in terms of mAP(\%), achieving a relative improvement of 21.7\%. Favorable result is also obtained on ActivityNet.
研究动机与目标
- 为解决在动作定位任务中,尽管更深的网络在2D目标检测中表现更优,但深层时间卷积神经网络(TCNs)性能下降的问题。
- 探究为何堆叠更多传统TCN层会导致动作定位中分类损失增加和性能下降。
- 提出一种新模块——概念级时间卷积(CTC),在保留概念判别能力的同时,通过共享的多潜在滤波器丰富时序表征。
- 通过缓解标准TCN中概念重组的负面影响,使动作定位任务中能够构建更深的网络架构。
- 在标准基准数据集THUMOS’14和ActivityNet上实现最先进性能,且不依赖外部视频级分类结果。
提出的方法
- 引入一种概念级时间卷积(CTC)层,对每个特征概念独立应用共享的时序滤波器,减少概念间的重组。
- 将1D特征图表示为形状为(潜在数,概念)的2D张量,实现在概念间共享参数的逐概念滤波。
- 设计CTC层以保持概念特异性表征,同时通过参数共享捕捉共有的时序模式。
- 通过堆叠CTC层构建深层C-TCN架构,实现在不引起性能下降的前提下构建更深网络。
- 在特征金字塔中引入自顶向下和横向连接,以增强多尺度表征学习能力。
- 采用双流主干网络和基于锚点的检测头进行训练,同时优化定位与分类任务。
实验结果
研究问题
- RQ1为何在2D目标检测中性能随深度提升的深层网络,在动作定位任务中使用传统时间卷积神经网络(TCNs)时反而导致性能下降?
- RQ2标准TCNs中抽象特征概念的重组如何损害动作分类任务中的判别性表征学习?
- RQ3每个概念共享的多潜在时序滤波器是否能提升表征学习能力,同时减少深层TCNs中的概念重组?
- RQ4概念级时间卷积模块(CTC)在多大程度上可实现动作定位中更深的网络架构而无性能下降?
- RQ5所提出的C-TCN架构是否在THUMOS’14和ActivityNet等标准基准上实现了最先进性能?
主要发现
- 在tIoU=0.5时,C-TCN在THUMOS’14上达到52.1%的新最先进mAP,相对于之前最先进方法的42.8%提升了21.7%。
- 在ActivityNet v1.3上,C-TCN在tIoU=0.5时达到47.6%的mAP,优于所有对比方法,且未使用外部视频级分类结果。
- 消融实验表明,若移除自顶向下和横向连接,mAP将降至47.7%,证实其在最优架构设计中的关键作用。
- 若移除CTC模块并恢复为标准TCN,则随着网络加深性能下降,验证了所提模块的必要性。
- AR-AN曲线分析显示,C-TCN在低AN区域表现优于其他方法,表明其提议框质量更优,这对mAP更具意义,也更贴近定位性能。
- 定性结果表明,C-TCN在复杂场景中能成功定位动作,但偶尔会将视觉线索相似的动作误分类,如飞盘接住与足球点球。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。