[論文レビュー] Learning Domain-Aware Detection Head with Prompt Tuning
本稿では、ビジョン・ランゲージ モデル(VLM)バックボーンと学習可能なドメイン適応プロンプトを用いて、ソースドメインおよびターゲットドメインの動的検出ヘッドを生成する、新しいドメイン適応型オブジェクト検出フレームワークDA-Proを提案する。ドメイン不変およびドメイン固有のトークンを二重制約とプロンプトアンサンブル戦略で同時に最適化することで、RegionCLIPなどの強力なベースラインを上回る、1.9%〜3.3%のmAP向上を達成した。
Domain adaptive object detection (DAOD) aims to generalize detectors trained on an annotated source domain to an unlabelled target domain. However, existing methods focus on reducing the domain bias of the detection backbone by inferring a discriminative visual encoder, while ignoring the domain bias in the detection head. Inspired by the high generalization of vision-language models (VLMs), applying a VLM as the robust detection backbone following a domain-aware detection head is a reasonable way to learn the discriminative detector for each domain, rather than reducing the domain bias in traditional methods. To achieve the above issue, we thus propose a novel DAOD framework named Domain-Aware detection head with Prompt tuning (DA-Pro), which applies the learnable domain-adaptive prompt to generate the dynamic detection head for each domain. Formally, the domain-adaptive prompt consists of the domain-invariant tokens, domain-specific tokens, and the domain-related textual description along with the class label. Furthermore, two constraints between the source and target domains are applied to ensure that the domain-adaptive prompt can capture the domains-shared and domain-specific knowledge. A prompt ensemble strategy is also proposed to reduce the effect of prompt disturbance. Comprehensive experiments over multiple cross-domain adaptation tasks demonstrate that using the domain-adaptive prompt can produce an effectively domain-related detection head for boosting domain-adaptive object detection. Our code is available at https://github.com/Therock90421/DA-Pro.
研究の動機と目的
- 既存の手法が検出バックボーンのバイアス低減に注力している中で、無視されがちな検出ヘッドにおけるドメインバイアスを是正すること。
- ビジョン・ランゲージ モデル(VLM)の高い汎化性能を活用し、ドメイン適応のための強力な視覚エンコーダーとして活用すること。
- ドメイン不変およびドメイン固有のトークンを用いて、動的にドメイン固有の検出ヘッドを生成する学習可能なプロンプトメカニズムを設計すること。
- 検出ヘッドの信頼度とアライメントに対する二重制約を用いて、ドメイン間で共有される知識と特異な知識を的確に捉えること。
- EMAベースのバッファ更新を用いた履歴プロンプトアンサンブル戦略により、トレーニング中のプロンプトの摂動を低減すること。
提案手法
- 事前学習済みVLMをバックボーンとして用い、ドメインに一般化された視覚特徴を抽出する。
- ドメイン適応プロンプトは、学習可能なドメイン不変トークン、ドメイン固有トークン、およびドメインとクラスのテキスト記述から構成される。
- 二重の制約を適用する:(1) ソースおよびターゲットの検出ヘッドを同時に最適化して共有知識を保持し、(2) ドメイン固有の信頼度を最大化して識別性能を向上させる。
- プロンプトアンサンブル戦略により、EMAを用いたバッファ更新で過去のプロンプトの移動平均を保持し、バッチレベルのデータ変動に対して耐性を高める。
- 検出ヘッドは、VLM内のクロスアテンションを用いてプロンプトトークンと視覚特徴に注目することで、動的に生成される。
- 全トレーニング目的関数は、分類損失、ドメイン信頼度損失、エントロピー正則化を組み合わせ、最適化の安定化を図る。
実験結果
リサーチクエスチョン
- RQ1ドメイン適応型オブジェクト検出において、プロンプトチューニングがドメインに適応した検出ヘッドを学習するために効果的に適用可能か?
- RQ2プロンプトベースの検出ヘッドにおいて、ドメイン不変およびドメイン固有の知識をどのように共同でモデル化できるか?
- RQ3ソースドメインとターゲットドメインの両方で検出ヘッドが良好に一般化するようにするために、どのような制約が必要か?
- RQ4プロンプトアンサンブルは、データ分布のシフト下でも性能と耐性を向上させるか?
- RQ5プロンプト長は、DAODにおける識別性能と過学習のトレードオフにどのように影響を与えるか?
主な発見
- DA-Proは、クロスウェザー、クロスFOV、シミュレーションから実世界への移行(Sim-to-Real)の3つのクロスドメインベンチマークで、最先端の性能を達成した。
- クロスウェザーベンチマークでは、mAPが55.9%に達し、SOTAを更新した。これはRegionCLIPを1.9%〜3.3%上回った。
- アブレーションスタディの結果、ドメイン固有トークンと二重制約を追加することで、ドメイン不変トークンのみを用いた場合に比べてmAPが0.4%向上した。
- プロンプトアンサンブル戦略により、AP、AP50、AP75の各指標で、それぞれ0.7%、0.4%、1.5%のmAP向上が得られ、プロンプトの摂動が低減した。
- ドメイン不変およびドメイン固有トークンのプロンプト長が(8,8)の組み合わせが最適であり、それ以上の長さでは過学習が顕著に見られた。
- 可視化結果から、ドメイン適応プロンプトは重複する物体や隠れている物体を正しく検出している一方で、手作業で作成したプロンプトやドメイン不変プロンプトは、それらを誤って無視または誤分類していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。