[論文レビュー] End-to-End Video Object Detection with Spatial-Temporal Transformers
本稿では、光-flow や再帰的ネットワークといった手作業で設計されたコンponentを排除する空間的・時間的トランスフォーマー構造に基づいたエンドツーエンドの動画オブジェクト検出フレームワーク、TransVOD を提案する。時間的可変トランスフォーマー・デコーダーと、新たな粗大から精細へのクエリ集約戦略を導入することで、ImageNet VID において可変DETR よりも 3%-4% の mAP 向上を達成し、洗練されたエンドツーエンドパイプラインで最先端の性能を示した。
Recently, DETR and Deformable DETR have been proposed to eliminate the need for many hand-designed components in object detection while demonstrating good performance as previous complex hand-crafted detectors. However, their performance on Video Object Detection (VOD) has not been well explored. In this paper, we present TransVOD, an end-to-end video object detection model based on a spatial-temporal Transformer architecture. The goal of this paper is to streamline the pipeline of VOD, effectively removing the need for many hand-crafted components for feature aggregation, e.g., optical flow, recurrent neural networks, relation networks. Besides, benefited from the object query design in DETR, our method does not need complicated post-processing methods such as Seq-NMS or Tubelet rescoring, which keeps the pipeline simple and clean. In particular, we present temporal Transformer to aggregate both the spatial object queries and the feature memories of each frame. Our temporal Transformer consists of three components: Temporal Deformable Transformer Encoder (TDTE) to encode the multiple frame spatial details, Temporal Query Encoder (TQE) to fuse object queries, and Temporal Deformable Transformer Decoder to obtain current frame detection results. These designs boost the strong baseline deformable DETR by a significant margin (3%-4% mAP) on the ImageNet VID dataset. TransVOD yields comparable results performance on the benchmark of ImageNet VID. We hope our TransVOD can provide a new perspective for video object detection. Code will be made publicly available at https://github.com/SJTU-LuHe/TransVOD.
研究の動機と目的
- 光-flow や RNN、関係性ネットワークなどの複雑で手作業で設計されたコンponent を排除することで、動画オブジェクト検出を簡素化すること。
- トランスフォーマーを用いて長距離の時間的依存関係をモデル化することで、DETR のエンドツーエンド検出パラダイムを動画に拡張すること。
- Seq-NMS や tubelet 再スコアリングといった後処理のボトル neck を統一されたアテンションベースのアーキテクチャによって排除すること。
- 時間的アテンションが複数フレーム間で空間的オブジェクトクエリと特徴メモリを統合する有効性を検証すること。
- 自己アテンション機構を用いて、洗練され、効果的な新しいベースラインを動画オブジェクト検出に確立すること。
提案手法
- 可変アテンションを用いて複数フレームの空間的特徴を符号化する時間的可変トランスフォーマー・エンコーダー(TDTE)を導入する。
- 参照フレームを跨いで空間的オブジェクトクエリを粗大から精細に集約する時間的クエリエンコーダー(TQE)を提案する。
- 時間的オブジェクトクエリと特徴メモリを用いて、現在フレームの検出結果を生成する時間的可変トランスフォーマー・デコーダー(TDTD)を採用する。
- 最終デコーダー出力を用いて、バウンディングボックスとクラススコアを予測する共通のフィードフォワードネットワーク(FFN)を用いる。
- DETR からのオブジェクトクエリの初期化を活用することで、NMS や後処理を一切用いずにエンドツーエンド学習を可能にする。
- 空間的および時間的エンコーダーの両方で可変アテンションを適用し、フレームおよび空間的位置を跨いで関連する特徴に効率的に注目する。

実験結果
リサーチクエスチョン
- RQ1手作業で設計されたコンponent を一切使用せずに、トランスフォーマーに基づくアーキテクチャが動画オブジェクト検出において長距離の時間的依存関係を効果的にモデル化できるか?
- RQ2TQE における提案された粗大から精細へのクエリ集約戦略は、フレーム間の特徴統合をどのように向上させるか?
- RQ3動画検出における時間的モデリングにおいて、最適な参照フレーム数とエンコーダー/デコーダー層の数は何か?
- RQ4エンドツーエンドのトランスフォーマーに基づく検出器は、光-flow や RNN を使用しない強力な2段階ベースライン(可変DETR)を動画ベンチマークで上回れるか?
- RQ5Seq-NMS や tubelet 再スコアリングといった後処理手順を排除した純粋なアテンションベースの設計において、性能が低下するか?
主な発見
- TransVOD は ImageNet VID の検証セットにおいて、強力なベースラインである可変DETR よりも 3%-4% の mAP 向上を達成した。
- TDTE エンコーダー層の最適数は1層であることが判明し、より深い時間的符号化が性能向上に寄与しないことを示した。
- TDTD デコーダーに1層で十分であることが示され、効果的な検出には深いデコーディングが不要であることを示唆した。
- TQE における粗大から精細へのクエリ集約戦略は、粗大から粗大および精細から精細の選択より優れており、深層の100個のトップ-k クエリで 79.8% の mAP を達成した。
- 8つ以上の参照フレームで性能が安定化し、14個の参照フレームで mAP が 79.3% でピークに達した。
- 光-flow や RNN、および tubelet スコアリングのような複雑な後処理を一切使用せず、ImageNet VID で最先端の性能を達成した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。