Skip to main content
QUICK REVIEW

[论文解读] Video Self-Stitching Graph Network for Temporal Action Localization

Chen Zhao, Ali Thabet|arXiv (Cornell University)|Nov 30, 2020
Human Pose and Action Recognition参考文献 45被引用 8
一句话总结

该论文提出视频自拼接图网络(VSGN),一种用于时序动作定位的新框架,通过视频自拼接(VSS)和跨尺度图金字塔网络(xGPN)融合原始视频片段与时间放大后的视频片段,提升短时动作检测性能。VSGN在THUMOS-14和ActivityNet-v1.3数据集上达到最先进性能,显著提升了短时动作的mAP,通过利用多尺度间的互补特征并生成更多正样本锚点实现。

ABSTRACT

Temporal action localization (TAL) in videos is a challenging task, especially due to the large variation in action temporal scales. Short actions usually occupy a major proportion in the datasets, but tend to have the lowest performance. In this paper, we confront the challenge of short actions and propose a multi-level cross-scale solution dubbed as video self-stitching graph network (VSGN). We have two key components in VSGN: video self-stitching (VSS) and cross-scale graph pyramid network (xGPN). In VSS, we focus on a short period of a video and magnify it along the temporal dimension to obtain a larger scale. We stitch the original clip and its magnified counterpart in one input sequence to take advantage of the complementary properties of both scales. The xGPN component further exploits the cross-scale correlations by a pyramid of cross-scale graph networks, each containing a hybrid module to aggregate features from across scales as well as within the same scale. Our VSGN not only enhances the feature representations, but also generates more positive anchors for short actions and more short training samples. Experiments demonstrate that VSGN obviously improves the localization performance of short actions as well as achieving the state-of-the-art overall performance on THUMOS-14 and ActivityNet-v1.3.

研究动机与目标

  • 为解决未剪辑视频中短时动作定位性能差的长期挑战,此类动作数量占主导但现有方法表现不佳。
  • 通过利用多时间尺度间的互补信息,克服单尺度特征表示的局限性。
  • 开发一种多层次跨尺度框架,以增强特征表示并增加短时动作的正样本数量。
  • 通过时间上采样生成合成短时动作样本以扩充数据集,缓解训练过程中对长时动作的偏见。
  • 利用基于图的金字塔网络有效实现跨尺度特征聚合,捕捉跨尺度的长程依赖关系。

提出的方法

  • 视频自拼接(VSS)通过时间放大短视频片段,生成更大尺度的版本,然后将原始片段与放大片段拼接为单一输入序列,以保留互补信息。
  • 跨尺度图金字塔网络(xGPN)使用混合模块,在多个编码器层级上处理特征,通过学习的图连接在尺度内和跨尺度间聚合特征。
  • xGPN中的每个节点使用K/2尺度内边和K/2跨尺度边,以建模不同时间尺度间特征的关系。
  • 该框架采用多层级架构,xGPN应用于每个编码器层级,实现渐进式特征优化和跨尺度信息流动。
  • 模型采用端到端训练,使用标准TAL损失,推理时结合原始片段与放大片段的预测结果,以提升检测精度。
  • 该方法避免使用昂贵的3D卷积和ROI对齐,实现低推理成本的同时保持高性能。

实验结果

研究问题

  • RQ1对短时视频片段进行时间放大是否能提升时序动作定位中短时动作的特征表示与检测性能?
  • RQ2如何有效建模跨尺度特征相关性,以增强不同时间持续时长动作的定位能力?
  • RQ3结合原始片段与放大片段的预测结果是否能优于单独使用任一者,因其具有互补优势?
  • RQ4在图网络中,内尺度与跨尺度边的最优配置为何种组合,才能在不同动作持续时间下实现性能最大化?
  • RQ5所提框架是否能在不增加模型复杂度或推理成本的前提下,缩小短时与长时动作之间的性能差距?

主要发现

  • VSGN在0.5 IoU阈值下于ActivityNet-v1.3数据集上达到35.07%的最先进mAP,短时动作(持续时间<30秒)mAP高达19.9%,优于所有先前方法。
  • 原始片段与放大片段预测结果的结合(Clip O + Clip U)实现35.07%的平均mAP,超过任一单独片段的预测性能(0.5 IoU下分别为52.38%和51.80%),证明其互补优势。
  • 在xGPN中使用K/2自由边与K/2跨尺度边时性能最佳,mAP达35.07%;而仅使用K条自由边或K条跨尺度边时性能下降。
  • 在所有编码器层级均应用xGPN可实现最高mAP(35.07%),优于仅在单一层级使用xGN的模型;当单独使用时,中间层级(第3层)效果最佳。
  • VSGN在ActivityNet验证集上实现158秒的快速推理时间,与BMN相当,快于G-TAD,尽管其锚点数量更少(1240 vs. 4950)且无需ROI对齐。
  • 与次优方法相比,VSGN将短时动作mAP提升了0.6个百分点,表明在最具挑战性的动作类别上实现了显著增益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。