[论文解读] Temporal Query Networks for Fine-grained Video Understanding
本文提出时序查询网络(TQN),一种基于Transformer的架构,通过将每个动作类别视为需从未修剪视频中回答的查询,实现细粒度视频动作识别。利用时序注意力机制与随机特征库,实现密集、内存高效的训练,TQN仅使用RGB特征即在FineGym和Diving48数据集上达到最先进性能,展现出对不同持续时间下短时、细微动作的优越建模能力。
Our objective in this work is fine-grained classification of actions in untrimmed videos, where the actions may be temporally extended or may span only a few frames of the video. We cast this into a query-response mechanism, where each query addresses a particular question, and has its own response label set. We make the following four contributions: (I) We propose a new model - a Temporal Query Network - which enables the query-response functionality, and a structural understanding of fine-grained actions. It attends to relevant segments for each query with a temporal attention mechanism, and can be trained using only the labels for each query. (ii) We propose a new way - stochastic feature bank update - to train a network on videos of various lengths with the dense sampling required to respond to fine-grained queries. (iii) We compare the TQN to other architectures and text supervision methods, and analyze their pros and cons. Finally, (iv) we evaluate the method extensively on the FineGym and Diving48 benchmarks for fine-grained action classification and surpass the state-of-the-art using only RGB features.
研究动机与目标
- 解决在未修剪视频中进行细粒度动作识别的问题,其中动作在时间上短暂且视觉上细微,需精确的时间定位。
- 实现基于查询的视频理解,将每个动作类别视为需从视频中回答的独立问题。
- 在长时、未修剪视频上实现有效训练,尽管存在GPU显存限制,仍采用密集时间采样。
- 开发一种支持弱监督学习的训练框架,仅提供查询级别标签,无需时间边界框或帧级标注。
- 在仅使用RGB特征的前提下,超越现有方法在细粒度基准测试中的准确率,避免使用昂贵的光流或3D卷积。
提出的方法
- 时序查询网络(TQN)采用基于Transformer的架构,对每个查询关注相关视频片段,实现基于查询的响应预测。
- 每个查询关联一个可学习的查询向量,通过多头自注意力机制在整个视频上进行注意力计算,聚焦于相关的时间片段。
- 引入随机特征库以处理密集采样:每个训练步骤仅计算并反向传播从密集采样片段中随机选取的一小部分特征。
- 在训练过程中以随机方式更新特征库,使模型能从多样化的时序上下文中学习,同时避免耗尽GPU显存。
- 模型采用端到端训练,仅使用查询级别标签,无需边界框或帧级标注。
- 该方法通过在全视频时长上实现细粒度时间敏感度,支持短时动作(如0.3秒)与长序列的建模。
实验结果
研究问题
- RQ1基于可学习注意力机制的查询-响应框架能否有效定位并分类未修剪视频中的细粒度动作?
- RQ2在GPU显存受限的条件下,如何高效地在长时、未修剪视频上进行密集时间采样训练?
- RQ3在不使用光流或3D卷积的情况下,模型在仅使用RGB特征的前提下,能在多大程度上实现细粒度动作识别的最先进性能?
- RQ4与标准训练相比,随机特征库更新策略在长视频序列上的收敛性与性能表现如何?
- RQ5扩展且密集的时间上下文对建模细粒度视频理解中细微动作差异的影响如何?
主要发现
- TQN模型在FineGym数据集上实现了最先进性能,且仅使用RGB特征即超越了先前方法。
- 在Diving48基准测试中,采用随机特征库的TQN优于现有方法,即使后者使用了额外监督或光流信息。
- 消融实验确认,随机特征库对长视频密集采样下的训练稳定性与性能至关重要。
- 该模型在短时、细微动作(如0.3秒)上表现出色,表明时间注意力能有效保留细粒度信号。
- 基于查询的机制能更好地区分视觉外观相似但时间结构不同的动作。
- 该方法在不依赖物体或背景线索的情况下实现高准确率,展现出对细粒度动作识别挑战的鲁棒性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。