Skip to main content
QUICK REVIEW

[論文レビュー] An Extendable, Efficient and Effective Transformer-based Object Detector

Hwanjun Song, Deqing Sun|arXiv (Cornell University)|Apr 17, 2022
Advanced Neural Network Applications被引用数 11
ひとこと要約

本稿では、再構成注意モジュール(RAM)を介してビジョン Transformer(ViT)と検出 Transformer(DETR)を統合することで、線形計算量と高い効率性を実現する、完全に Transformer に基づくオブジェクト検出器である ViDT を提案する。エンド・ツー・エンドの Transformer 検出器の中で、AP-遅延トレードオフの分野で最先端の性能を達成しており、ViDT+ は大型バックボーンを用いて COCO で 53.2 AP を達成し、最小バージョンではたった 14M パラメータで運用可能である。

ABSTRACT

Transformers have been widely used in numerous vision problems especially for visual recognition and detection. Detection transformers are the first fully end-to-end learning systems for object detection, while vision transformers are the first fully transformer-based architecture for image classification. In this paper, we integrate Vision and Detection Transformers (ViDT) to construct an effective and efficient object detector. ViDT introduces a reconfigured attention module to extend the recent Swin Transformer to be a standalone object detector, followed by a computationally efficient transformer decoder that exploits multi-scale features and auxiliary techniques essential to boost the detection performance without much increase in computational load. In addition, we extend it to ViDT+ to support joint-task learning for object detection and instance segmentation. Specifically, we attach an efficient multi-scale feature fusion layer and utilize two more auxiliary training losses, IoU-aware loss and token labeling loss. Extensive evaluation results on the Microsoft COCO benchmark dataset demonstrate that ViDT obtains the best AP and latency trade-off among existing fully transformer-based object detectors, and its extended ViDT+ achieves 53.2AP owing to its high scalability for large models. The source code and trained models are available at https://github.com/naver-ai/vidt.

研究の動機と目的

  • ビジョン Transformer と検出 Transformer 間の単純な統合による非効率性とスケーラビリティの制限を解消すること。
  • アンカー生成や非最大抑制を必要とせず、エンド・ツー・エンドの訓練が可能なオブジェクト検出器の実現。
  • マルチスケール特徴の統合と補助学習技術をサポートする、軽量で効率的なネックアーキテクチャの設計。
  • 最小限の計算コスト増加で、オブジェクト検出とインスタンスセグメンテーションの両方をサポートする統合アーキテクチャへの拡張。
  • 最小モデルバージョンでたった 14M パラメータで、高精度と高速な推論のトレードオフを達成すること。

提案手法

  • スイッチトランスフォーマーなどの ViT バリエーションが、1つの注意メカニズム内でパッチトークンと検出トークンの両方を処理できるようにする再構成注意モジュール(RAM)を導入し、画像サイズに対して線形の計算量を実現。
  • エンコーダーを不要とする軽量なネックデコーダーを採用し、検出トークンを直接処理するとともに、マルチスケール特徴を活用して表現学習を向上。
  • IoUに配慮した損失関数とトークンラベル損失を適用し、各検出ヘッドのトークンごとに細かい監視を提供。
  • 異なるスケール間での特徴表現を強化するための効率的なマルチスケール特徴統合モジュール(EPFF)を導入。
  • エンド・ツー・エンドのインスタンスセグメンテーションを可能にするために、特徴ピラミッドと共同学習の目的関数を追加することで、ViDT を ViDT+ に拡張。
  • 推論時にデコーダー層を一部削除するスキームを採用し、精度の低下を最小限に抑えつつ、処理速度を向上。

実験結果

リサーチクエスチョン

  • RQ1ViT と DETR アーキテクチャを統合することで、完全に Transformer に基づくオブジェクト検出器が、高精度と低遅延の両立を達成できるか?
  • RQ2注意メカニズムの計算量をどのように低減すれば、線形計算量を実現し、スケーラブルなオブジェクト検出を可能にするか?
  • RQ3推論コストを増加させずに、検出性能を向上させるために効果的な補助学習技術は何か?
  • RQ4統一されたアーキテクチャが、最小限のパラメータと計算コスト増加で、オブジェクト検出とインスタンスセグメンテーションの両方をサポートできるか?
  • RQ5ハイパーパramータの選択(例:検出トークン数、学習エポック数、デコーダー層数)によって、精度と速度の最適なトレードオフが得られるか?

主な発見

  • ViDT は、COCO ベンチマークにおいて、既存の完全に Transformer に基づくオブジェクト検出器の中で、最高の平均精度(AP)と遅延のトレードオフを達成している。
  • Swin-nano バックボーンを用いることで、1400万パラメータで 47.0 AP box を達成し、高い推論速度を維持している。
  • 大型の Swin-base バックボーンを用いた ViDT+ は、COCO で 53.2 AP box を達成し、大規模モデルにおける高いスケーラビリティを示している。
  • 検出トークン数を 100 から 300 に増加させることで、AP box が 1.7–1.9 ポints 向上し、遅延の増加は最小限に抑えられる。
  • 150 エポック(3倍長)の学習により、AP box が 2.2–2.4 ポイント向上し、FPS の低下は見られない。
  • 推論時に 2 層のデコーダー層を削除することで、FPS が 10% 以上向上し、AP box の低下もわずかである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。