Skip to main content
QUICK REVIEW

[論文レビュー] AttentionNAS: Spatiotemporal Attention Cell Search for Video Classification

Xiaofang Wang, Xuehan Xiong|arXiv (Cornell University)|Jul 23, 2020
Advanced Neural Network Applications参考文献 42被引用数 7
ひとこと要約

本稿では、動画分類のための空間的・時系列的注意セルを自動で発見する神経ネットワークアーキテクチャ探索フレームワークであるAttentionNASを提案する。マップベースおよびドット積注意演算の微分可能探索空間を導入することで、I3DおよびS3Dバックボーンの性能をKinetics-600およびMiTで2%以上向上させ、非局所ブロックを上回り、モダリティ、バックボーン、データセットの across に一般化可能である。

ABSTRACT

Convolutional operations have two limitations: (1) do not explicitly model where to focus as the same filter is applied to all the positions, and (2) are unsuitable for modeling long-range dependencies as they only operate on a small neighborhood. While both limitations can be alleviated by attention operations, many design choices remain to be determined to use attention, especially when applying attention to videos. Towards a principled way of applying attention to videos, we address the task of spatiotemporal attention cell search. We propose a novel search space for spatiotemporal attention cells, which allows the search algorithm to flexibly explore various design choices in the cell. The discovered attention cells can be seamlessly inserted into existing backbone networks, e.g., I3D or S3D, and improve video classification accuracy by more than 2% on both Kinetics-600 and MiT datasets. The discovered attention cells outperform non-local blocks on both datasets, and demonstrate strong generalization across different modalities, backbones, and datasets. Inserting our attention cells into I3D-R50 yields state-of-the-art performance on both datasets.

研究の動機と目的

  • 畳み込み演算の限界、例えば固定された受容 field と長距離依存関係のモデル化不能性を是正するため。
  • 既存の動画バックボーンネットワークにスムーズに統合可能な、原理的で自動化された注意セル設計手法を開発するため。
  • 次元性(時系列、空間的、または空間時系列的)および注意メカニズムの構成を含む、空間的・時系列的注意演算の設計空間を探索するため。
  • 発見された注意セルが、異なるモダリティ(例:RGBから光センサデータ)、バックボーン(例:I3DからS3D)、データセット(例:MiTからKinetics-600)にわたって一般化可能であるようにするため。

提案手法

  • マップベース注意とドット積(自己注意)の2つの基本的注意演算を用いた、空間的・時系列的注意セルのための新規探索空間を提案する。
  • 探索空間の微分可能定式化を導入することで、バックプロパゲーションを介したエンドツーエンド学習が可能となり、ネットワーク重みと注意セルアーキテクチャを同時に最適化できる。
  • 計算コストを低減しつつ、アーキテクチャ空間を効率的に探索するため、ガウス過程バンディット(GPB)と微分可能NASを併用する。
  • 微分可能定式化により、異なる層に対して異なるアーキテクチャを学習可能となる位置固有の注意セル設計をサポートし、追加コストゼロで実現可能である。
  • 空間的・時系列的・空間時系列的次元における注意演算の柔軟な組み合わせを許容する探索空間を採用する。
  • I3D や S3D などの既存バックボーンに、アーキテクチャの変更なしに発見された注意セルを挿入可能であり、プラグアンドプレイによる性能向上を実現する。

実験結果

リサーチクエスチョン

  • RQ1畳み込みセルにとどまらず、神経ネットワークアーキテクチャ探索を注意ベースのセルに拡張することは可能か?
  • RQ2空間的・時系列的注意演算の設計空間を体系的に探索することで、動画理解モデルの性能向上が図れるか?
  • RQ3RGBフレームで発見された注意セルは、再訓練なしに光センサデータモダリティに効果的に一般化可能か?
  • RQ4S3Dで発見された注意セルは、I3Dやその深層版(例:I3D-R50)など、他のバックボーンや深層バージョンに対しても効果的に一般化可能か?
  • RQ5MiTで発見された注意セルは、Kinetics-600など他のデータセットに対しても一般化可能か?逆もまた然りか?

主な発見

  • 微分可能探索手法により、I3DおよびS3DバックボーンがKinetics-600およびMiTの両データセットで2%以上向上した。
  • 位置固有の注意セルは、位置に依存しない設計を常に上回り、空間的・時系列的文脈に配慮した注意の利点を示している。
  • RGBフレームで発見されたセルは、光センサデータモダリティに効果的に一般化され、探索時にフローデータを一切使用しない状態で、I3Dの精度をKinetics-600で5.67%向上させた。
  • S3Dで発見されたセルは、I3Dの性能を両データセットで約2%向上させたが、I3Dの最適化を一切行っていなかったにもかかわらず、強力なクロスバックボーン一般化を示した。
  • MiTで発見されたセルはKinetics-600に一般化され、2%以上の精度向上を達成した。逆にKinetics-600で発見されたセルもMiTに一般化可能であり、強力なクロスデータセット転送性を示した。
  • 最良の発見された注意セルをI3D-R50に挿入することで、Kinetics-600(トップ1精度77.86%)およびMiT(トップ1精度32.48%)の両方でSOTA性能を達成し、RGBとフローデータを併用したAssembleNet-50を上回った。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。