[论文解读] Learning Sparse 2D Temporal Adjacent Networks for Temporal Action Localization
该论文提出了一种稀疏二维时间邻接网络(S-2D-TAN),通过一种结构化且稀疏的采样策略,建模提议之间长距离的时间依赖性,以在不同长度的提议间平衡上下文感知,从而提升时序动作定位性能。该方法在HACS测试集上实现了23.49 mAP的性能,凭借对2D-TAN中上下文不平衡问题的有效缓解,通过紧凑的分层特征图处理与独立动作分类器的分数融合,赢得了2019年挑战赛冠军。
In this report, we introduce the Winner method for HACS Temporal Action Localization Challenge 2019. Temporal action localization is challenging since a target proposal may be related to several other candidate proposals in an untrimmed video. Existing methods cannot tackle this challenge well since temporal proposals are considered individually and their temporal dependencies are neglected. To address this issue, we propose sparse 2D temporal adjacent networks to model the temporal relationship between candidate proposals. This method is built upon the recent proposed 2D-TAN approach. The sampling strategy in 2D-TAN introduces the unbalanced context problem, where short proposals can perceive more context than long proposals. Therefore, we further propose a Sparse 2D Temporal Adjacent Network (S-2D-TAN). It is capable of involving more context information for long proposals and further learning discriminative features from them. By combining our S-2D-TAN with a simple action classifier, our method achieves a mAP of 23.49 on the test set, which win the first place in the HACS challenge.
研究动机与目标
- 为解决2D-TAN中短提议在特征提取过程中比长提议获取更多上下文的上下文感知不平衡问题。
- 通过一种稀疏、分层的采样策略,显式建模候选提议之间的时间关系,以提升时序动作定位性能。
- 通过基于提议长度重构特征图为紧凑子图的方式,增强长提议的特征学习。
- 通过重叠分数预测与动作分类的融合,在HACS数据集上实现最先进性能。
提出的方法
- 该方法构建一个二维时间图,其中行和列分别代表候选提议的起始和结束时间,特征图来源于SlowFast主干网络。
- 按提议长度稀疏采样:短提议(≤N/4)密集采样,中等长度提议(N/4 < l ≤ N/2)以步长2采样,长提议(N/2 < l ≤ N)以步长4采样,形成三个紧凑的子图。
- 每个子图通过共享的四层卷积网络处理,卷积核大小为9,使用零填充以保持空间维度,随后将特征恢复至原始图布局。
- 通过全连接层与Sigmoid激活函数预测重叠分数,采用IoU阈值为t_min=0.5和t_max=1.0的软二元交叉熵损失。
- 在与真实框IoU > 0.5的提议上训练一个独立的动作分类器,使用全连接层与Softmax预测类别分数。
- 最终检测分数通过重叠分数与分类分数的逐元素相乘计算,推理阶段再经过NMS处理。
实验结果
研究问题
- RQ1如何在时序动作定位中有效建模提议间的时间依赖性以改善特征学习?
- RQ2短提议与长提议之间上下文感知的不平衡在2D-TAN中在多大程度上损害了性能,以及如何纠正?
- RQ3分层的、基于长度感知的采样策略是否能提升不同持续时间提议的特征表示与模型泛化能力?
- RQ4将重叠分数预测与独立动作分类融合,是否能提升在未剪辑视频数据集上的定位准确率?
主要发现
- 所提出的S-2D-TAN在HACS测试集上实现了23.49 mAP,夺得2019年时序动作定位挑战赛第一名。
- 消融实验表明,增大感受野(从1层增至9层)使AR@100从49.85%提升至63.25%,AUC从42.32%提升至58.11%。
- 在保持感受野不变的前提下增加候选提议数量,使性能从第3行的55.24% AR@100提升至第2行的63.25%。
- 所提出的基于长度的子图处理稀疏卷积策略使AR@100提升至67.25%,AUC提升至62.40%(第1行),优于标准2D-TAN。
- S-2D-TAN与独立动作分类器的最终融合在HACS测试集上实现了最高的23.49 mAP。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。