[論文レビュー] An Extendable, Efficient and Effective Transformer-based Object Detector
本稿では、再構成注意モジュール(RAM)を介してビジョン Transformer(ViT)と検出 Transformer(DETR)を統合することで、線形計算量と高い効率性を実現する、完全に Transformer に基づくオブジェクト検出器である ViDT を提案する。エンド・ツー・エンドの Transformer 検出器の中で、AP-遅延トレードオフの分野で最先端の性能を達成しており、ViDT+ は大型バックボーンを用いて COCO で 53.2 AP を達成し、最小バージョンではたった 14M パラメータで運用可能である。
Transformers have been widely used in numerous vision problems especially for visual recognition and detection. Detection transformers are the first fully end-to-end learning systems for object detection, while vision transformers are the first fully transformer-based architecture for image classification. In this paper, we integrate Vision and Detection Transformers (ViDT) to construct an effective and efficient object detector. ViDT introduces a reconfigured attention module to extend the recent Swin Transformer to be a standalone object detector, followed by a computationally efficient transformer decoder that exploits multi-scale features and auxiliary techniques essential to boost the detection performance without much increase in computational load. In addition, we extend it to ViDT+ to support joint-task learning for object detection and instance segmentation. Specifically, we attach an efficient multi-scale feature fusion layer and utilize two more auxiliary training losses, IoU-aware loss and token labeling loss. Extensive evaluation results on the Microsoft COCO benchmark dataset demonstrate that ViDT obtains the best AP and latency trade-off among existing fully transformer-based object detectors, and its extended ViDT+ achieves 53.2AP owing to its high scalability for large models. The source code and trained models are available at https://github.com/naver-ai/vidt.
研究の動機と目的
- ビジョン Transformer と検出 Transformer 間の単純な統合による非効率性とスケーラビリティの制限を解消すること。
- アンカー生成や非最大抑制を必要とせず、エンド・ツー・エンドの訓練が可能なオブジェクト検出器の実現。
- マルチスケール特徴の統合と補助学習技術をサポートする、軽量で効率的なネックアーキテクチャの設計。
- 最小限の計算コスト増加で、オブジェクト検出とインスタンスセグメンテーションの両方をサポートする統合アーキテクチャへの拡張。
- 最小モデルバージョンでたった 14M パラメータで、高精度と高速な推論のトレードオフを達成すること。
提案手法
- スイッチトランスフォーマーなどの ViT バリエーションが、1つの注意メカニズム内でパッチトークンと検出トークンの両方を処理できるようにする再構成注意モジュール(RAM)を導入し、画像サイズに対して線形の計算量を実現。
- エンコーダーを不要とする軽量なネックデコーダーを採用し、検出トークンを直接処理するとともに、マルチスケール特徴を活用して表現学習を向上。
- IoUに配慮した損失関数とトークンラベル損失を適用し、各検出ヘッドのトークンごとに細かい監視を提供。
- 異なるスケール間での特徴表現を強化するための効率的なマルチスケール特徴統合モジュール(EPFF)を導入。
- エンド・ツー・エンドのインスタンスセグメンテーションを可能にするために、特徴ピラミッドと共同学習の目的関数を追加することで、ViDT を ViDT+ に拡張。
- 推論時にデコーダー層を一部削除するスキームを採用し、精度の低下を最小限に抑えつつ、処理速度を向上。
実験結果
リサーチクエスチョン
- RQ1ViT と DETR アーキテクチャを統合することで、完全に Transformer に基づくオブジェクト検出器が、高精度と低遅延の両立を達成できるか?
- RQ2注意メカニズムの計算量をどのように低減すれば、線形計算量を実現し、スケーラブルなオブジェクト検出を可能にするか?
- RQ3推論コストを増加させずに、検出性能を向上させるために効果的な補助学習技術は何か?
- RQ4統一されたアーキテクチャが、最小限のパラメータと計算コスト増加で、オブジェクト検出とインスタンスセグメンテーションの両方をサポートできるか?
- RQ5ハイパーパramータの選択(例:検出トークン数、学習エポック数、デコーダー層数)によって、精度と速度の最適なトレードオフが得られるか?
主な発見
- ViDT は、COCO ベンチマークにおいて、既存の完全に Transformer に基づくオブジェクト検出器の中で、最高の平均精度(AP)と遅延のトレードオフを達成している。
- Swin-nano バックボーンを用いることで、1400万パラメータで 47.0 AP box を達成し、高い推論速度を維持している。
- 大型の Swin-base バックボーンを用いた ViDT+ は、COCO で 53.2 AP box を達成し、大規模モデルにおける高いスケーラビリティを示している。
- 検出トークン数を 100 から 300 に増加させることで、AP box が 1.7–1.9 ポints 向上し、遅延の増加は最小限に抑えられる。
- 150 エポック(3倍長)の学習により、AP box が 2.2–2.4 ポイント向上し、FPS の低下は見られない。
- 推論時に 2 層のデコーダー層を削除することで、FPS が 10% 以上向上し、AP box の低下もわずかである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。