Skip to main content
QUICK REVIEW

[论文解读] AttentionNAS: Spatiotemporal Attention Cell Search for Video Classification

Xiaofang Wang, Xuehan Xiong|arXiv (Cornell University)|Jul 23, 2020
Advanced Neural Network Applications参考文献 42被引用 7
一句话总结

本文提出 AttentionNAS,一种神经架构搜索框架,可自动发现用于视频分类的时空注意力单元。通过在基于特征图的注意力与点积注意力操作之间构建可微分的搜索空间,该方法发现的注意力单元在 Kinetics-600 和 MiT 数据集上使 I3D 和 S3D 主干网络的性能提升超过 2%,优于非局部模块,并在不同模态、主干网络和数据集之间具有良好的泛化能力。

ABSTRACT

Convolutional operations have two limitations: (1) do not explicitly model where to focus as the same filter is applied to all the positions, and (2) are unsuitable for modeling long-range dependencies as they only operate on a small neighborhood. While both limitations can be alleviated by attention operations, many design choices remain to be determined to use attention, especially when applying attention to videos. Towards a principled way of applying attention to videos, we address the task of spatiotemporal attention cell search. We propose a novel search space for spatiotemporal attention cells, which allows the search algorithm to flexibly explore various design choices in the cell. The discovered attention cells can be seamlessly inserted into existing backbone networks, e.g., I3D or S3D, and improve video classification accuracy by more than 2% on both Kinetics-600 and MiT datasets. The discovered attention cells outperform non-local blocks on both datasets, and demonstrate strong generalization across different modalities, backbones, and datasets. Inserting our attention cells into I3D-R50 yields state-of-the-art performance on both datasets.

研究动机与目标

  • 为解决卷积操作在视频分类中的局限性,如感受野固定和难以建模长距离依赖关系。
  • 开发一种系统化、自动化的注意力单元设计方法,可无缝集成到现有视频主干网络中。
  • 系统探索时空注意力操作的设计空间,包括维度(时间、空间或时空)以及注意力机制的组合方式。
  • 实现所发现的注意力单元在不同模态(如 RGB 到光流)、主干网络(如 I3D 到 S3D)以及数据集(如 MiT 到 Kinetics-600)之间的泛化能力。

提出的方法

  • 提出一种新颖的时空注意力单元搜索空间,基于两种基本注意力操作:基于特征图的注意力与点积注意力(自注意力)。
  • 引入搜索空间的可微分形式,支持通过反向传播进行端到端训练,联合优化网络权重与注意力单元架构。
  • 结合高斯过程Bandit(GPB)与可微分NAS方法,高效搜索架构空间,显著降低计算成本。
  • 通过可微分形式支持针对不同层学习独立的注意力单元设计,实现位置特定的注意力单元,且无需额外计算开销。
  • 采用支持在空间、时间及时空维度上灵活组合注意力操作的搜索空间。
  • 将所发现的注意力单元无缝插入 I3D 和 S3D 等现有主干网络中,无需修改网络结构,实现即插即用的性能提升。

实验结果

研究问题

  • RQ1神经架构搜索能否超越卷积单元,扩展至发现适用于视频分类的最优注意力基元?
  • RQ2如何系统性地探索时空注意力操作的设计空间,以提升视频理解模型的性能?
  • RQ3在一种模态(如 RGB)上发现的注意力单元能否在无需微调的情况下有效泛化到另一种模态(如光流)?
  • RQ4在一种主干网络(如 S3D)上发现的注意力单元能否在其他主干网络(如 I3D)或更深的变体(如 I3D-R50)上表现良好?
  • RQ5在某一数据集(如 MiT)上发现的注意力单元能否泛化到另一数据集(如 Kinetics-600),反之亦然?

主要发现

  • 可微分搜索方法发现的注意力单元在 Kinetics-600 和 MiT 数据集上使 I3D 和 S3D 主干网络的性能均提升超过 2%。
  • 位置特定的注意力单元始终优于位置无关的设计,证明了空间与时间上下文感知注意力的优势。
  • 在 RGB 帧上发现的注意力单元能有效泛化到光流模态,在搜索过程中未使用任何光流数据的情况下,使 I3D 在 Kinetics-600 上的准确率提升 5.67%。
  • 在 S3D 上发现的注意力单元使 I3D 在两个数据集上的性能均提升约 2%,即使这些单元从未针对 I3D 进行优化,表明其具备强大的跨主干网络泛化能力。
  • 在 MiT 上发现的注意力单元可泛化到 Kinetics-600,实现超过 2% 的准确率增益,反之亦然,表明其具备强大的跨数据集迁移能力。
  • 将最佳发现的注意力单元插入 I3D-R50 后,在 Kinetics-600(77.86% top-1)和 MiT(32.48% top-1)上均达到当前最先进性能,优于使用 RGB 和光流双流输入的 AssembleNet-50。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。