Skip to main content
QUICK REVIEW

[論文レビュー] MTTrans: Cross-Domain Object Detection with Mean-Teacher Transformer

Jinze Yu, Jiaming Liu|arXiv (Cornell University)|May 3, 2022
Advanced Neural Network Applications被引用数 4
ひとこと要約

MTTransは、可変的DETRにおける平均教師訓練フレームワークとマルチレベル特徴一致に基づくエンドツーエンドのクロスドメイン物体検出フレームワークを提案する。教師モデルが未ラベルのターゲットデータから高品質な疑似ラベルを生成し、グローバル、インスタンス、ローカルの各レベルでドメイン間の特徴を一致させることで、MTTransは最先端の性能を達成し、特にSim10kからCityscapesへのベンチマークでmAPを52.6から57.9へ向上させた。

ABSTRACT

Recently, DEtection TRansformer (DETR), an end-to-end object detection pipeline, has achieved promising performance. However, it requires large-scale labeled data and suffers from domain shift, especially when no labeled data is available in the target domain. To solve this problem, we propose an end-to-end cross-domain detection Transformer based on the mean teacher framework, MTTrans, which can fully exploit unlabeled target domain data in object detection training and transfer knowledge between domains via pseudo labels. We further propose the comprehensive multi-level feature alignment to improve the pseudo labels generated by the mean teacher framework taking advantage of the cross-scale self-attention mechanism in Deformable DETR. Image and object features are aligned at the local, global, and instance levels with domain query-based feature alignment (DQFA), bi-level graph-based prototype alignment (BGPA), and token-wise image feature alignment (TIFA). On the other hand, the unlabeled target domain data pseudo-labeled and available for the object detection training by the mean teacher framework can lead to better feature extraction and alignment. Thus, the mean teacher framework and the comprehensive multi-level feature alignment can be optimized iteratively and mutually based on the architecture of Transformers. Extensive experiments demonstrate that our proposed method achieves state-of-the-art performance in three domain adaptation scenarios, especially the result of Sim10k to Cityscapes scenario is remarkably improved from 52.6 mAP to 57.9 mAP. Code will be released.

研究の動機と目的

  • ラベル付きのソースドメインからラベルなしのターゲットドメインに移行する際のドメインシフトを解消すること。
  • アノテーションが欠如しているため、従来の自己教師的ドメイン適応手法がターゲットドメインの未ラベルデータを十分に活用できないという制限を克服すること。
  • ドメインシフトの下で、平均教師フレームワークが生成する疑似ラベルの品質を向上させること。
  • Transformerベースの検出器におけるドメイン不変表現学習を強化するための包括的なマルチレベル特徴一致戦略を開発すること。
  • エンドツーエンドの方法で、疑似ラベル生成と特徴一致の反復的かつ相互的な最適化を可能にすること。

提案手法

  • 平均教師フレームワークを、ソースドメインとターゲットドメイン間の分布シフトが顕著に現れる物体検出における自己教師的ドメイン適応(UDA)に適応させ、教師モデルの指数的移動平均(EMA)を用いた学生・教師モデルの構成を採用する。
  • ドメインクエリベース特徴一致(DQFA)を導入し、スケール間の自己注意機構を用いて、グローバルな画像およびオブジェクトプロポーザル特徴をドメイン間で一致させる。
  • 二段階グラフベースプロトタイプ一致(BGPA)を提案し、オブジェクト特徴から構築したプロトタイプを介してインスタンスレベルの特徴をモデル化・一致させる。
  • トークン単位の画像特徴一致(TIFA)を実装し、画像特徴マップのトークンレベルでローカルレベルの特徴を一致させる。
  • 平均教師フレームワークとマルチレベル特徴一致を統合し、エンドツーエンドで疑似ラベル品質と特徴一致を同時に最適化する。
  • 訓練中にターゲットドメインの疑似ラベルデータを活用し、特徴抽出とモデル一般化性能を向上させ、未ラベルデータの完全な活用を可能にする。

実験結果

リサーチクエスチョン

  • RQ1ソースドメインとターゲットドメインの間で顕著な分布シフトが生じる状況下でも、平均教師フレームワークが自己教師的ドメイン適応における物体検出に効果的に適応可能か?
  • RQ2教師モデルがドメイン不変でない場合に、ドメインシフト下で平均教師が生成する疑似ラベルの品質をどのように向上できるか?
  • RQ3Transformerベースの物体検出器におけるドメイン不変表現学習を強化するために、どのマルチレベル特徴一致戦略が最も効果的か?
  • RQ4疑似ラベル生成と特徴一致の共同最適化が、クロスドメイン設定における検出性能にどの程度向上効果をもたらすか?
  • RQ5提案フレームワークの個々の構成要素(例:DQFA、BGPA、TIFA)が、ドメイン適応における全体的な性能向上にどの程度寄与しているか?

主な発見

  • MTTransは、Sim10kからCityscapesへのベンチマークで、以前のSOTAである52.6 mAPから57.9 mAPへと新たな最先端のmAPを達成した。
  • アブレーションスタディの結果、デコーダ固有のDQFAコンponentを削除すると性能が最も著しく低下(-0.451 mAP)し、グローバル特徴一致においてその重要性が明確になった。
  • デコーダでBGPAをTIFAに置き換えたり、エンコーダでTIFAをBGPAに置き換えたりした場合、それぞれ-0.460 mAPおよび-0.345 mAPの性能低下を示し、コンponent固有の設計の重要性が裏付けられた。
  • 教師と学生モデル間の共有オブジェクトクエリを削除すると、性能低下が最大(-0.616 mAP)となり、一貫性のあるクエリ学習の必要性が確認された。
  • 疑似ラベルの可視化結果から、MTTransはMT-DefDETRよりも高品質な疑似ラベルを生成しており、教師モデルの予測が学生モデルよりも正確であることが確認され、効果的な知識蒸留が可能であることが示された。
  • Foggy Cityscapesにおける定性的な結果から、MTTransはDeformable DETRやSFAと比較して、遠く離れた物体や濃霧に覆われた物体をよりよく検出しており、真正陽性の信頼度スコアも高いことが分かった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。