[论文解读] Actor-Context-Actor Relation Network for Spatio-Temporal Action Localization
本文提出ACAR-Net,一种新颖的演员-上下文-演员关系网络,通过推理演员与其共享的上下文互动之间的间接连接,在时空动作定位中建模高阶关系。通过引入高阶关系推理算子和演员-上下文特征库,该方法在AVA-Kinetics 2020挑战赛中取得最先进性能,较之前方法提升+6.71 mAP。
Localizing persons and recognizing their actions from videos is a challenging task towards high-level video understanding. Recent advances have been achieved by modeling direct pairwise relations between entities. In this paper, we take one step further, not only model direct relations between pairs but also take into account indirect higher-order relations established upon multiple elements. We propose to explicitly model the Actor-Context-Actor Relation, which is the relation between two actors based on their interactions with the context. To this end, we design an Actor-Context-Actor Relation Network (ACAR-Net) which builds upon a novel High-order Relation Reasoning Operator and an Actor-Context Feature Bank to enable indirect relation reasoning for spatio-temporal action localization. Experiments on AVA and UCF101-24 datasets show the advantages of modeling actor-context-actor relations, and visualization of attention maps further verifies that our model is capable of finding relevant higher-order relations to support action detection. Notably, our method ranks first in the AVA-Kineticsaction localization task of ActivityNet Challenge 2020, out-performing other entries by a significant margin (+6.71mAP). Training code and models will be available at https://github.com/Siyu-C/ACAR-Net.
研究动机与目标
- 为解决时空动作定位中成对关系建模的局限性,该方法通常会遗漏关键的高阶上下文线索。
- 通过其与周围上下文的共享互动,显式建模演员之间的间接关系,而非仅依赖直接的演员-演员或演员-对象关系。
- 开发一种灵活的端到端可训练框架,无需预训练的目标检测器或预定义的对象类别来表示上下文。
- 通过捕捉跨多个演员和时空位置的细粒度、上下文依赖关系,提升动作定位的准确性。
提出的方法
- 该方法提出一种演员-上下文-演员关系网络(ACAR-Net),通过其共享的上下文互动建模演员之间的二阶关系。
- 采用完全卷积的高阶关系推理算子,作用于一阶关系特征图,保留空间布局并支持全局上下文推理。
- 演员-上下文特征库在多个时间步上存储并聚合演员-上下文关系,实现对间接关系的时序建模。
- 上下文特征直接从SlowFast主干网络的时空网格特征图中提取,消除了对外部目标检测器的依赖。
- 网络处理从RoI池化得到的演员特征和来自主干特征图的上下文特征,通过共享上下文计算注意力加权的关系。
- 整个框架端到端可训练,基于预训练的视频主干网络运行,无需额外检测头或类别特定监督。
实验结果
研究问题
- RQ1通过共享上下文互动建模演员之间的间接高阶关系,是否能超越成对关系建模,在时空动作定位中实现性能提升?
- RQ2缺乏预训练目标检测器是否会影响上下文表示在动作定位中的鲁棒性和泛化能力?
- RQ3演员之间隐式、由上下文中介的关系在多大程度上能提升对依赖多智能体交互的动作(如'骑'或'传递')的识别能力?
- RQ4所提出的高阶关系推理算子是否能有效捕捉场景中空间和时间上一致的线索以支持动作检测?
- RQ5ACAR-Net能否在多样化的数据集和动作类别上泛化,包括具有复杂人-物体和人-人交互的场景?
主要发现
- ACAR-Net在AVA-Kinetics 2020测试集上达到39.62 mAP,排名第一,较其他所有参赛方法显著提升+6.71 mAP。
- 在AVA数据集上,通过显式建模演员-上下文-演员关系,该方法相较基线提升+2.86 mAP。
- 在UCF101-24上,ACAR-Net在未使用演员-上下文特征库时达到84.3 mAP,使用基线时为82.4 mAP,展现出强大的泛化能力和鲁棒性。
- 定性可视化结果表明,模型能够学习关注与动作中介相关的相关上下文区域,如手、手臂和物体。
- 高阶关系推理算子成功编码了隐式的二阶关系,例如通过驾驶员与方向盘的互动推断出'骑'的动作。
- 该方法在不同数据集间泛化良好,在AVA和UCF101-24上均表现出一致的性能提升,表明其在多样化真实场景中的有效性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。