[论文解读] Augmented 2D-TAN: A Two-stage Approach for Human-centric Spatio-Temporal Video Grounding
本文提出了一种增强型2D-TAN(Augmented 2D-TAN),一种用于以人为中心的时空视频定位的两阶段方法,通过引入双向LSTM聚合模块和随机拼接增强(Random Concatenation Augmentation, RCA),在HC-STVG测试集上实现了31.9%的平均viou,达到当前最先进性能。
We propose an effective two-stage approach to tackle the problem of language-based Human-centric Spatio-Temporal Video Grounding (HC-STVG) task. In the first stage, we propose an Augmented 2D Temporal Adjacent Network (Augmented 2D-TAN) to temporally ground the target moment corresponding to the given description. Primarily, we improve the original 2D-TAN from two aspects: First, a temporal context-aware Bi-LSTM Aggregation Module is developed to aggregate clip-level representations, replacing the original max-pooling. Second, we propose to employ Random Concatenation Augmentation (RCA) mechanism during the training phase. In the second stage, we use pretrained MDETR model to generate per-frame bounding boxes via language query, and design a set of hand-crafted rules to select the best matching bounding box outputted by MDETR for each frame within the grounded moment.
研究动机与目标
- 解决以人为中心的时空视频定位(HC-STVG)挑战,目标是利用自然语言在时间和空间上定位特定人物。
- 克服现有2D-TAN模型的局限性,如因最大池化导致的过拟合和非判别性时序片段特征表示。
- 通过改进特征聚合与数据增强策略,提升时序定位的准确性。
- 通过结合时序与空间定位的两阶段流程,在HC-STVG基准上实现最先进性能。
提出的方法
- 提出一种双向LSTM聚合模块,替代2D-TAN中的最大池化操作,以更好地建模时序片段特征中的长期时间变化。
- 设计一种随机拼接增强(RCA)策略,在训练过程中随机拼接两个视频及其查询,以提升数据多样性并减少过拟合。
- 构建一个二维特征图 M ∈ ℝ^{N×N×c},其中 M_ij 通过双向LSTM聚合模块计算得到(仅对有效时序片段提议,即 i ≤ j),其余位置设为零。
- 使用预训练的MDETR模型生成每帧的边界框提议及对应定位文本,随后通过基于规则的过滤方法筛选最相关的边界框。
- 应用依存句法分析器提取输入句子中的主语,并过滤掉与主语不匹配或包含多人的MDETR输出。
- 从过滤后的集合中选择对应定位文本最长的边界框,作为每个定位时序段内各帧的最终空间预测结果。
实验结果
研究问题
- RQ1与2D-TAN中的最大池化相比,基于双向LSTM的聚合模块是否能提升时序片段特征的判别性?
- RQ2随机拼接增强(RCA)是否能有效减少过拟合并提升HC-STVG的泛化能力?
- RQ3结合时序定位与逐帧指代的两阶段流程是否能提升空间定位的准确性?
- RQ4双向LSTM聚合与RCA联合使用对整体HC-STVG性能有何影响?
- RQ5所提方法在HC-STVG基准上与现有最先进方法相比表现如何?
主要发现
- 双向LSTM聚合模块将验证集上的viou@0.5得分从16.7%提升至18.8%,证明了其在特征表示上的优越性。
- 随机拼接增强(RCA)将验证集上的viou@0.5得分从16.7%提升至17.0%,表明其在泛化能力上的改进。
- 消融实验验证了双向LSTM与RCA均对性能提升有稳定贡献,联合方法在验证集上达到30.4%的viou@0.5。
- 10个增强型2D-TAN模型的集成在HC-STVG测试集上实现了31.9%的平均viou,优于排行榜上列出的所有先前方法。
- 所提方法在测试集上达到52.7%的viou@0.3与56.5%的tiou,进一步证实其在HC-STVG基准上的最先进性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。