[論文レビュー] Less is More: Focus Attention for Efficient DETR
Focus-DETRは、多スケールでトップダウン方式のスコアリング戦略を用いて、前景および細粒度オブジェクトトークンに選択的に注目する二重アテンション機構を提案する。これにより、COCOで50.4 APを達成し、クエリ数を30%削減したにもかかわらず、最先端のスパースDETRモデルと同等の計算コストを維持し、効率性と精度のトレードオフを顕著に改善した。
DETR-like models have significantly boosted the performance of detectors and even outperformed classical convolutional models. However, all tokens are treated equally without discrimination brings a redundant computational burden in the traditional encoder structure. The recent sparsification strategies exploit a subset of informative tokens to reduce attention complexity maintaining performance through the sparse encoder. But these methods tend to rely on unreliable model statistics. Moreover, simply reducing the token population hinders the detection performance to a large extent, limiting the application of these sparse models. We propose Focus-DETR, which focuses attention on more informative tokens for a better trade-off between computation efficiency and model accuracy. Specifically, we reconstruct the encoder with dual attention, which includes a token scoring mechanism that considers both localization and category semantic information of the objects from multi-scale feature maps. We efficiently abandon the background queries and enhance the semantic interaction of the fine-grained object queries based on the scores. Compared with the state-of-the-art sparse DETR-like detectors under the same setting, our Focus-DETR gets comparable complexity while achieving 50.4AP (+2.2) on COCO. The code is available at https://github.com/huawei-noah/noah-research/tree/master/Focus-DETR and https://gitee.com/mindspore/models/tree/master/research/cv/Focus-DETR.
研究の動機と目的
- 標準DETRエンコーダーがすべてのトークンを同一視するための高い計算コストを是正すること。
- 既存のスパースDETR手法がトークン選択に頼りがたいアテンションマップに依存するという制限を克服すること。
- 背景トークンの処理を削減しつつ、細粒度オブジェクトクエリを選択的に強化することで、検出精度を向上させること。
- 堅牢で多段階のトークンスコアリング機構を用いて、モデルの効率性と精度のバランスを改善すること。
- 最小限の計算オーバーヘッドで特徴量の精錬を向上させる、段階的で二重アテンションのエンコーダーを設計すること。
提案手法
- 局所化とカテゴリの意味的特徴に基づいて、学習可能なラベルと多スケール特徴マップを用いてトークンをスコアリングする前景トークンセレクタ(FTS)を導入する。
- トップダウン方式のスコアモodulationを採用し、高レベル特徴のスコアが低レベルの前景確率予測を精錬することで、選択の信頼性を向上させる。
- 前景の可能性と意味的特異性を同時に評価する多カテゴリスコア予測器を設計し、細粒度のトークン選択を可能にする。
- 二重アテンションを用いてエンコーダーを再構築する。1つは背景を除去した前景トークンに、もう1つは強化された細粒度クエリに注目し、長距離の特徴相互作用を向上させる。
- エンコーダー層全体に段階的な構造を適用し、前景トークンの数を段階的に削減しながらも、耐障害性と性能を維持する。
- デコーダーからのクロスアテンションマップを弱い監督信号としてのみ使用し、トークン選択に依存するのではなく、より堅牢な多スケール意味スコアリング機構に置き換える。
実験結果
リサーチクエスチョン
- RQ1多スケールでトップダウン方式のスコアリング機構は、スパースDETRモデルにおけるトークン選択の信頼性を向上させ得るか?
- RQ2意味的感度のあるスコアリングにより細粒度オブジェクトトークンに注目することで、計算コストを増加させずに検出精度を向上させられるか?
- RQ3選択的トークン処理と組み合わせたエンコーダー内での二重アテンションは、特徴表現をどのように向上させるか?
- RQ4段階的トークンプリーニング戦略は、アクティブなトークン数を段階的に削減しながらも性能を維持できるか?
- RQ5最先端のスパースDETRモデルと比較して、本手法は精度、計算コスト、耐障害性の観点でどのように差をつけるか?
主な発見
- Focus-DETRは、元のクエリ数の30%にまで削減したにもかかわらず、COCOで50.4 APを達成し、ベースラインのDeformable DETRより+2.2 APの向上を達成した。
- 128 GFLOPsの計算量で、Focus-DETRはSparse DETRより+2.7 AP、DINOにSparse DETR戦略を適用した場合より+1.4 APを上回り、同程度の計算予算下で優れた性能を示した。
- 二重アテンション機構は+0.8 APの貢献を示し、強化された細粒度トークン相互作用が検出性能を顕著に向上させることを裏付けた。
- トップダウンスコアモジュレーション戦略は、ボトムアップモジュレーションよりも0.2 APの向上をもたらし、高レベルの意味的ガイダンスが低レベルの選択に有効であることを実証した。
- エンコーダー内に段階的構造を導入することで、耐障害性が向上し、+0.5 APの性能向上が得られた。これは、段階的精錬の利点を示している。
- Focus-DETRは、128 GFLOPsで23.7 FPSという高い推論速度を維持しながらも、最先端の精度を達成しており、その効率性とスケーラビリティを実証した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。