Skip to main content
QUICK REVIEW

[論文レビュー] Gated Domain-Invariant Feature Disentanglement for Domain Generalizable Object Detection

Haozhuo Zhang, Huimin Yu|arXiv (Cornell University)|Mar 22, 2022
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿では、チャネルごとのゲート信号を学習するチャネルゲートモジュール(CGM)を用いて、ドメイン固有表現(DSR)専用のチャネルをマスクするbinaryに近いゲート信号を生成することで、ドメイン不変表現(DIR)とドメイン固有表現(DSR)を分離する、ドメイン一般化可能なオブジェクト検出のための新規手法Gated Domain-Invariant Feature Disentanglement(GDIFD)を提案する。このCGMにより、チャネル単位でのクリアな分離が可能となり、標準ベンチマークにおいて最先端の性能を達成する。

ABSTRACT

For Domain Generalizable Object Detection (DGOD), Disentangled Representation Learning (DRL) helps a lot by explicitly disentangling Domain-Invariant Representations (DIR) from Domain-Specific Representations (DSR). Considering the domain category is an attribute of input data, it should be feasible for networks to fit a specific mapping which projects DSR into feature channels exclusive to domain-specific information, and thus much cleaner disentanglement of DIR from DSR can be achieved simply on channel dimension. Inspired by this idea, we propose a novel DRL method for DGOD, which is termed Gated Domain-Invariant Feature Disentanglement (GDIFD). In GDIFD, a Channel Gate Module (CGM) learns to output channel gate signals close to either 0 or 1, which can mask out the channels exclusive to domain-specific information helpful for domain recognition. With the proposed GDIFD, the backbone in our framework can fit the desired mapping easily, which enables the channel-wise disentanglement. In experiments, we demonstrate that our approach is highly effective and achieves state-of-the-art DGOD performance.

研究の動機と目的

  • ドメイン固有表現(DSR)からドメイン不変表現(DIR)をよりクリアに分離できるように、ドメイン一般化可能なオブジェクト検出(DGOD)を向上させること。
  • 従来のDRL手法が畳み込み層を重ねる構造を採用しているが、DSR専用のチャネルを保証しない点を是正すること。
  • ドメインカテゴリを属性として活用し、DSRに特定のチャネルを明示的に割り当てることで、チャネル次元に沿ったより効果的な分離を可能にすること。
  • バイナリに近いチャネル選択を強制する軽量で学習可能なゲートメカニズムを用いて、優れたDGOD性能を達成すること。

提案手法

  • チャネルごとのゲート信号 $ S_{di} $ を出力するチャネルゲートモジュール(CGM)を導入し、新しいゲート損失により、その信号が0または1に近づくように制約する。
  • ゲート信号はバックボーン特徴 $ F_b $ に対して要素ごとの乗算を適用し、ドメイン固有情報に専用化されたチャネルをマスクする。
  • DSR用のチャネルの使用を最小限に抑えるために、CGMを1に近い値で初期化する。
  • ゲート信号がバイナリに近い挙動を示すように、バイナリに近いゲート信号の実現を促進するためのゲート損失を提案する。
  • 敵対的アライメントを用いて、DIRとDSRの独立性をさらに促進する。
  • 共有バックボーンとDIR用の単一の浅いエンコーダーのみを用いることで、効率的かつスケーラブルな分離を実現する。

実験結果

リサーチクエスチョン

  • RQ1学習可能なバイナリに近いゲート信号を用いることで、ドメイン不変およびドメイン固有特徴のチャネルワイズ分離を効果的に達成できるか?
  • RQ2ゲート信号を0または1に近づけることで、従来のアテンション機構と比較して、特徴分離の品質が顕著に向上するか?
  • RQ3複雑なマルチバックボーンまたは再構築ベースのDRL手法に比べ、軽量なチャネルゲーティング機構がDGODで優れた性能を発揮できるか?
  • RQ4特別な初期化とゲート損失の組み合わせが、CGMの性能および分離品質にどのように影響するか?
  • RQ5提案手法GDIFDは、同等またはそれ以上の性能を示すか、教師なしドメイン適応(UDAOD)設定に一般化可能か?

主な発見

  • 特別な初期化とゲート損失を併用したCGMが最良の性能を示し、B&C to Fベンチマークで38.3%のmAPを達成し、すべてのアブレーションバリアントを上回る。
  • ゲート損失を適用しない場合、ゲート信号はグレーアウト(中間値)となり、DIRとDSRの間でエンタングルメントが生じ、性能の低下を引き起こす。
  • 特別な初期化とゲート損失を併用した場合、B&C to F設定ではドメイン分類に1つのチャネルのみが割り当てられるよう学習される。これにより、DSRの干渉が最小限に抑えられる。
  • アブレーションスタディにより、ゲート損失と特別な初期化の両方が、クリアでバイナリに近いチャネルゲーティングと最適な分離を達成するために不可欠であることが確認された。
  • UDAOD設定では、同じFCOSベースラインを用いた場合、GDIFDはCFA(41.4% vs. 40.2%)よりもmAPを1.2%向上させ、優れた転送性を示した。
  • 複数のDGODベンチマークにおいて、本手法は最先端の性能を達成しており、その有効性と一般化能力が検証された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。