[论文解读] Asynchronous Interaction Aggregation for Action Detection
该论文提出了一种异步交互聚合(AIA)网络用于视频动作检测,通过分层的交互聚合(IA)结构和异步记忆更新(AMU)算法,整合人物-人物、人物-物体及时间交互,以高效建模长距离依赖关系。AIA在AVA数据集上达到最先进性能(31.2 mAP,较基线提升3.7 mAP),并在UCF101-24和EPIC-Kitchens上展现出优异的泛化能力。
Understanding interaction is an essential part of video action detection. We propose the Asynchronous Interaction Aggregation network (AIA) that leverages different interactions to boost action detection. There are two key designs in it: one is the Interaction Aggregation structure (IA) adopting a uniform paradigm to model and integrate multiple types of interaction; the other is the Asynchronous Memory Update algorithm (AMU) that enables us to achieve better performance by modeling very long-term interaction dynamically without huge computation cost. We provide empirical evidence to show that our network can gain notable accuracy from the integrative interactions and is easy to train end-to-end. Our method reports the new state-of-the-art performance on AVA dataset, with 3.7 mAP gain (12.6% relative improvement) on validation split comparing to our strong baseline. The results on dataset UCF101-24 and EPIC-Kitchens further illustrate the effectiveness of our approach. Source code will be made public at: https://github.com/MVIG-SJTU/AlphAction .
研究动机与目标
- 解决现有动作检测方法仅建模单一类型交互(如人物-物体)或分别处理各类交互的局限性。
- 克服在不产生过高计算成本的前提下高效建模长期时间交互的挑战。
- 实现端到端训练深度网络,联合利用多样化的人物-上下文交互以提升时空动作定位性能。
- 在AVA、UCF101-24和EPIC-Kitchens等多个基准上验证所提框架的泛化能力。
提出的方法
- 提出一种交互聚合(IA)结构,通过在网络深度方向嵌套基本交互模块,分层整合人物-人物、人物-物体和时间三类交互。
- 采用一种新颖的异步记忆更新(AMU)算法,动态存储并检索过去帧的空间特征,以建模长距离时间依赖关系,无需预先提取特征。
- 使用类似记忆的结构,将目标帧的特征写入记忆池,并在后续迭代中检索,以模拟长期上下文建模。
- 通过写入-读取机制近似难以处理的长期记忆特征,避免计算成本随序列长度线性增长,从而实现端到端训练。
- 将IA与AMU组件整合为统一框架,可使用标准反向传播进行训练,并与标准视频主干网络架构联合优化。
- 在多个数据集上采用一致实现:UCF101-24使用ResNet-50/C2D,EPIC-Kitchens使用SlowFast主干网络并结合特征级交互建模。
实验结果
研究问题
- RQ1统一的深度架构能否有效整合多种人物-上下文交互(人物-人物、人物-物体、时间)以提升动作检测准确率?
- RQ2高效的记忆机制能否在不预计算特征或产生高计算成本的前提下,动态建模长期时间交互?
- RQ3所提出的异步记忆更新(AMU)算法能否实现具有长距离依赖关系的网络的稳定端到端训练?
- RQ4AIA框架能否在AVA、UCF101-24和EPIC-Kitchens等多样化基准上实现一致的性能提升并展现良好泛化能力?
- RQ5与仅依赖局部或单一交互特征的模型相比,所集成的交互机制在检测复杂、长时程动作方面贡献有多大?
主要发现
- AIA在AVA v2.2验证集上达到新的最先进水平,mAP为32.26,较强基线提升3.7 mAP(相对提升12.6%)。
- 在AVA v2.1上,AIA-R101达到31.2 mAP,优于此前最先进方法(SlowFast)3.0 mAP。
- 在UCF101-24上,AIA-Serial达到78.5 mAP,较C2D基线提升3.3%,即使使用轻量级2D主干网络也表现出色。
- 在EPIC-Kitchens上,AIA-Dense-Serial在动词识别上达到60.0% top-1准确率,较基线提升3.2%;在动作识别上达到27.7% top-1准确率,提升3.6%。
- 消融实验证实,联合建模三类交互显著提升性能,各组件均对最终性能增益有贡献。
- AMU算法在计算开销极小的前提下实现有效的长距离建模,使端到端训练既可行又高效。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。