[論文レビュー] Domain Generalization by Mutual-Information Regularization with Pre-trained Models
本稿では、事前学習モデルとターゲットモデル間の相互情報量を最大化することで、頑健でドメイン不変の表現を学習するドメイン一般化手法MIROを提案する。大規模な事前学習バックボーンを用いて理想のオラクルモデルを近似することで、MIROはDomainBedベンチマークで最先端の性能を達成し、特にCLIP や SWAG のような大規模な事前学習モデルにおいて顕著な向上を示す。
Domain generalization (DG) aims to learn a generalized model to an unseen target domain using only limited source domains. Previous attempts to DG fail to learn domain-invariant representations only from the source domains due to the significant domain shifts between training and test domains. Instead, we re-formulate the DG objective using mutual information with the oracle model, a model generalized to any possible domain. We derive a tractable variational lower bound via approximating the oracle model by a pre-trained model, called Mutual Information Regularization with Oracle (MIRO). Our extensive experiments show that MIRO significantly improves the out-of-distribution performance. Furthermore, our scaling experiments show that the larger the scale of the pre-trained model, the greater the performance improvement of MIRO. Source code is available at https://github.com/kakaobrain/miro.
研究の動機と目的
- 既存のドメイン一般化手法が、ソースドメインのバイアスに過剰適合することで、大きな分布シフトに失敗するという限界を解消すること。
- ドメイン一般化を、ターゲットモデルとすべてのドメインに一般化するオラクルモデルとの間の相互情報量を最大化する問題に再定式化すること。
- 計算が困難なオラクルモデルを、大規模な事前学習モデルを用いて近似することで、実用的で最適化可能な手法を開発すること。
- MIROと組み合わせた大規模な事前学習モデルが、単純なファインチューニングとは異なり、一般化性能を顕著に向上させることを実証すること。
- アーキテクチャの変更や複雑なトレーニングプロトコルを必要とせず、即挿し可能な正則化手法を提供すること。
提案手法
- ターゲットモデルの特徴量とオラクルモデルの特徴量の間の相互情報量を最大化するドメイン一般化の目的関数を再定式化する。
- 目的関数を実行可能にするために、大規模な事前学習モデル(例:ImageNet, CLIP, SWAG)を用いてオラクルモデルを近似する。
- 相互情報量の目的関数に対する変分下界を導出し、事前学習モデルとターゲットモデルの表現の間の微分可能な正則化項を導出する。
- 標準的な経験的リスク最小化(ERM)目的関数と、ハイパーパrameter λ で制御される相互情報量正則化項を組み合わせる。
- 事前学習モデルを初期化およびオラクル近似の両方の目的で使用することで、任意のバックボーンやデータセットに即挿し可能な統合を可能にする。
- ファインチューニング設定で本手法を適用し、正則化がターゲットモデルが事前学習モデルの頑健で一般化された特徴量に一致するように促進する。
実験結果
リサーチクエスチョン
- RQ1仮想のオラクルモデルとの相互情報量を最大化することで、ドメイン不変な特徴量の学習を越えてドメイン一般化が向上するか?
- RQ2大規模な事前学習モデルを用いてオラクルモデルを近似することで、標準的なファインチューニングよりも分布外一般化性能が向上するか?
- RQ3事前学習モデルのスケールがMIROによる性能向上にどのように影響するか?
- RQ4画像分類のImageNetと医療画像データセットの間で大きな分布シフトが生じた場合でも、相互情報量正則化は有効か?
- RQ5MIROを既存のアンサンブル手法と組み合わせることで、さらに頑健性が向上するか?
主な発見
- MIROは、すべての設定(異なる最適化手法や事前学習モデルを含む)において、DomainBedベンチマークで既存のすべての手法を上回る最先端の性能を達成した。
- ImageNetで事前学習されたResNet-50を用いると、MIROは平均精度を64.2%(ERM)から65.9%に向上させ、+1.7%の向上を達成した。
- CLIPで事前学習されたViT-Bを用いると、MIROは平均精度を61.1%(ERM)から73.7%に向上させ、+12.6%の顕著な向上を達成した。これは、大規模な事前学習モデルにおいて顕著な向上を示している。
- SWAGで事前学習されたRegNetY-16GFを用いると、MIROは平均精度を68.0%(ERM)から74.1%に向上させ、+6.1%の向上を達成した。
- SWADアンサンブル手法と組み合わせることで、SWAGバックボーンにおける平均精度はさらに77.3%に向上した。
- 特にCLIP や SWAG のような大規模な事前学習モデルを用いる際、MIROは単純なファインチューニングよりもオラクルモデルとの相互情報量が高かった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。