[論文レビュー] TokenLearner: What Can 8 Learned Tokens Do for Images and Videos?
TokenLearnerは、画像および動画からの重要な視覚トークンを適応的に選択する学習可能モジュールを導入し、ビジョントランスフォーマーにおける固定パッチベースのトークン化を置き換えます。空間的アテンションを用いて顕著な領域に注目することで、各層で処理するトークン数を削減し、ImageNetおよび複数の動画ベンチマークで最先端の性能を達成するとともに、計算量とメモリ使用量を50%以上削減します。
In this paper, we introduce a novel visual representation learning which relies on a handful of adaptively learned tokens, and which is applicable to both image and video understanding tasks. Instead of relying on hand-designed splitting strategies to obtain visual tokens and processing a large number of densely sampled patches for attention, our approach learns to mine important tokens in visual data. This results in efficiently and effectively finding a few important visual tokens and enables modeling of pairwise attention between such tokens, over a longer temporal horizon for videos, or the spatial content in images. Our experiments demonstrate strong performance on several challenging benchmarks for both image and video recognition tasks. Importantly, due to our tokens being adaptive, we accomplish competitive results at significantly reduced compute amount. We obtain comparable results to the state-of-the-arts on ImageNet while being computationally more efficient. We also confirm the effectiveness of the approach on multiple video datasets, including Kinetics-400, Kinetics-600, Charades, and AViD. The code is available at: https://github.com/google-research/scenic/tree/main/scenic/projects/token_learner
研究の動機と目的
- ビジョントランスフォーマーが数千個の固定パッチやチューブレットを処理する高コストな計算負荷に対処すること。
- 均等にサンプリングされたパッチの代わりに、代表的なトークンの少数を学習することで、画像および動画認識の効率性と正確性を向上させること。
- 最小限の計算オーバーヘッドで長距離の空間的および時間的依存関係を効果的にモデル化できること。
- 数百個の固定トークンを使用するモデルと同等またはそれを上回る性能を達成できるのは、わずか8〜16個の学習済みトークンで十分であることを示すこと。
提案手法
- TokenLearnerは、入力特徴から重要な領域を特定する学習可能な空間的アテンションメカニズムを用い、固定パッチベースのトークン化を置き換えます。
- 畳み込み層またはMLPを用いて、特徴マップ内の顕著な空間的領域を強調するアテンションマップを計算します。
- アテンションマップを入力特徴マップに適用して領域を適応的に重み付けした後、空間的平均プーリングを実行し、少数の学習済みトークンを生成します。
- 得られたトークンは、チャネルワイドの情報を保持するベクトル化された自己アテンションメカニズムを介して標準的なトランスフォーマーエンコーダーで処理されます。
- このモジュールは、ビジョントランスフォーマーの任意の層に挿入可能であり、ネットワーク全体にわたる柔軟な統合と計算の節約が可能になります。
- 同じメカニズムを空間的および時空間的特徴マップに適用することにより、画像および動画入力の両方をサポートします。
実験結果
リサーチクエスチョン
- RQ1高密度なパッチトークン化を置き換えるために、わずか数個の適応的学習トークンが性能を損なわずに使用可能か?
- RQ2適応的トークン選択の使用が、画像および動画認識タスクにおいて正確性を向上させるとともに計算コストを削減できるか?
- RQ3FLOPSと正確性の観点から、固定パッチ手法や他の最先端モデルと比較して、TokenLearnerはどのように性能を発揮するか?
- RQ4効率性と性能を最大化するには、最適なトークンの配置と数(例:8対16)は何か?
主な発見
- TokenLearnerは、FLOPSを50%以上削減しながら、最先端のモデルと同等のImageNet Top-1正確度を達成しました。
- Kinetics-400、Kinetics-600、Charades、AViDの各データセットにおいて、1フレームあたり8〜16個の学習済みトークンのみを用いたTokenLearnerベースのモデルが、新たな最先端の結果を樹立しました。
- ネットワークの初期段階(例:2番目または3番目の層)にTokenLearnerを挿入すると、より優れた正確度とより大きな効率的向上が得られました。
- アブレーションスタディにおいて、学習済みトークンを用いたベクトル化されたトランスフォーマー定式化は、標準的なマルチヘッド自己アテンション(MHSA)を上回り、Charadesで59.6%の正確度を達成しました。
- TokenLearner、ベクトル化されたアテンション、およびTokenFuserモジュールの組み合わせが最良の性能(Charadesで59.6%)をもたらし、全体パイプラインの有効性を示しました。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。