[论文解读] IF-TTN: Information Fused Temporal Transformation Network for Video Action Recognition
该论文提出 IF-TTN,一种视频动作识别模型,通过信息融合模块(IFM)在多个卷积神经网络层级上融合外观与运动特征,并利用时间变换网络(TTN)建模视频片段之间的中期时间变换。该方法在 UCF101(96.2%)和 HMDB51(74.8%)上实现了最先进性能,同时利用运动向量实现实时推理,在 UCF101 上达到 142 fps 与 94.5% 准确率——比基于光流的方法快 10 倍,且准确率相当。
Effective spatiotemporal feature representation is crucial to the video-based action recognition task. Focusing on discriminate spatiotemporal feature learning, we propose Information Fused Temporal Transformation Network (IF-TTN) for action recognition on top of popular Temporal Segment Network (TSN) framework. In the network, Information Fusion Module (IFM) is designed to fuse the appearance and motion features at multiple ConvNet levels for each video snippet, forming a short-term video descriptor. With fused features as inputs, Temporal Transformation Networks (TTN) are employed to model middle-term temporal transformation between the neighboring snippets following a sequential order. As TSN itself depicts long-term temporal structure by segmental consensus, the proposed network comprehensively considers multiple granularity temporal features. Our IF-TTN achieves the state-of-the-art results on two most popular action recognition datasets: UCF101 and HMDB51. Empirical investigation reveals that our architecture is robust to the input motion map quality. Replacing optical flow with the motion vectors from compressed video stream, the performance is still comparable to the flow-based methods while the testing speed is 10x faster.
研究动机与目标
- 通过在多个网络层级上有效融合外观与运动特征,提升视频动作识别中的时空特征表示能力。
- 建模视频片段之间的中期时间变换,捕捉超越短期描述符与长期共识的动态变化。
- 设计对低质量运动输入具有鲁棒性的架构,支持实际的实时部署。
- 在标准基准上实现最先进性能的同时,显著提升推理速度,超越基于光流的方法。
提出的方法
- 设计信息融合模块(IFM),在每个视频片段的多个卷积神经网络层级上连接并优化外观与运动特征,生成统一的短期视频描述符。
- 引入时间变换网络(TTN),用于建模相邻视频片段之间的序列变换,学习中期时间动态。
- TTN 处理由两个相邻片段提取的特征,学习其间的变换关系,捕捉运动轨迹与物体状态变化。
- IF-TTN 框架以端到端可训练方式集成 IFM 与 TTN,结合短期特征融合、中期时间建模以及 TSN 的长期片段共识。
- 该方法用压缩视频流中的运动向量替代光流,实现实时推理且准确率无明显下降。
- 通过 DeepDraw 进行类别可视化,证实 TTN 学习到了视频片段间有意义的时间过渡,例如跳高运动员从空中下落至落地的过程。
实验结果
研究问题
- RQ1在多个网络层级上联合融合外观与运动特征,是否能提升视频动作识别中判别性的时空表征?
- RQ2建模相邻视频片段之间的时间变换,是否能增强对短期片段特征与长期段落共识之外的中期时间建模能力?
- RQ3所提方法对运动输入质量下降(如使用运动向量而非光流)的鲁棒性如何?
- RQ4该模型能否在实现最先进准确率的同时,实现极低计算成本的实时推理?
主要发现
- IF-TTN 在 UCF101 上达到 96.2% 的最先进准确率,在 HMDB51 上达到 74.8%,优于此前方法(包括 I3D 和 Two-Stream TSN)。
- 使用运动向量的实时变体(MV-IF-TTN)在 UCF101 上达到 94.5% 准确率,优于以往实时方法,且与基于光流模型的性能相当。
- MV-IF-TTN 在单核 CPU 上运行速度达 142 fps,相比基于光流的 TSN 提升 10 倍,同时保持了具有竞争力的准确率。
- 用运动向量替代光流仅导致 0.6% 的性能下降,表明对运动输入质量具有高度鲁棒性。
- 类别可视化结果证实,TTN 学习到了片段间有意义的时间过渡,例如跳高动作中从奔跑至落地的运动变化。
- 多层级特征融合与序列时间建模的结合显著降低了对高质量运动输入的依赖,使模型在实时系统中具备实际部署可行性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。