[論文レビュー] On the Limitations of General Purpose Domain Generalisation Methods
本稿は、モデルのレーディンガー複雑度に基づく学習理論的一般化境界を用いて、ドメイン一般化(DG)のための新たな一般化境界を提示し、DG性能が経験的リスクとモデル複雑度のトレードオフによって支配されることを明らかにする。ドメイン単位の交差検証と正則化された経験的リスク最小化が、インスタンス単位の検証を上回り、モデル複雑度を内蔵的に制御することでより強い一般化性能を達成することを示している。
We investigate the fundamental performance limitations of learning algorithms in several Domain Generalisation (DG) settings. Motivated by the difficulty with which previously proposed methods have in reliably outperforming Empirical Risk Minimisation (ERM), we derive upper bounds on the excess risk of ERM, and lower bounds on the minimax excess risk. Our findings show that in all the DG settings we consider, it is not possible to significantly outperform ERM. Our conclusions are limited not only to the standard covariate shift setting, but also two other settings with additional restrictions on how domains can differ. The first constrains all domains to have a non-trivial bound on pairwise distances, as measured by a broad class of integral probability metrics. The second alternate setting considers a restricted class of DG problems where all domains have the same underlying support. Our analysis also suggests how different strategies can be used to optimise the performance of ERM in each of these DG setting. We also experimentally explore hypotheses suggested by our theoretical analysis.
研究の動機と目的
- 汎用的ドメイン一般化(DG)手法において、しばしばヒューリスティックに動機づけられるが、原理的理論的理解が不足している問題に対処すること。
- 広範な開発にもかかわらず、特に単純な経験的リスク最小化(ERM)ベースラインと比較して一貫性のない性能を示す既存のDG手法の理由を調査すること。
- 特に分布シフト下でのドメイン間一般化において、モデル複雑度と正則化の役割を明確にすること。
- 強力なDG性能を達成するための最適なモデル選択戦略—ドメイン単位の交差検証 vs インスタンス単位の交差検証—を特定すること。
- DGにおける性能のばらつきが、アーキテクチャ的・最適化的差異ではなく、モデル複雑度の内蔵的または明示的制御によって説明可能であることを示すこと。
提案手法
- ドメイン一般化のための新しい一般化境界を提案し、未学習ドメインにおける性能がモデルのレーディンガー複雑度に依存することを示し、学習ドメインへの過剰適合を捉える。
- 経験的リスクとモデル複雑度の間の理論的トレードオフを導出し、標準的なi.i.d.学習におけるバイアス・バリアンスのトレードオフに類似した関係を明らかにする。
- 線形モデルと市販の自己教師付き特徴量(例:DINO、ViT)を用いてモデル複雑度を分離・測定し、ニューラルネットワークの確率的性質を回避する。
- ドメインごとの1つを除いた交差検証(leave-one-domain-out cross-validation)をモデル選択の目的関数として用い、ドメイン一般化性能を直接最適化する。
- 線形SVMと正則化パラメータ(C)を用いたモデル複雑度の代理として、DomainBedベンチマークでドメイン単位とインスタンス単位の検証戦略を比較する。
- 複数のデータセット(PACS、VLCS、OfficeHomeなど)におけるハイパーパrameter(C)の選択と一般化性能の関係を分析する。
実験結果
リサーチクエスチョン
- RQ1レーディンガー複雑度で測定されるモデル複雑度は、ドメイン一般化における一般化性能にどのように影響を与えるか?
- RQ2多くの最先端DG手法が、よくチューニングされたERMベースラインを上回らないのはなぜか?これは、内蔵された正則化または複雑度制御によって説明可能か?
- RQ3未学習ドメインにわたる強力な一般化を達成するため、ドメイン単位の交差検証がインスタンス単位の交差検証よりも優れているとされるか?
- RQ4標準的なドメイン内性能と比較して、ドメイン一般化に最適な正則化の程度は何か?
- RQ5SOTA DG手法の不規則な性能は、アーキテクチャ的・最適化的差異ではなく、その誘導するモデル複雑度によって一貫して説明可能か?
主な発見
- 提案された一般化境界は、未学習ドメインにおける性能がドメイン内性能に加え、2つのモデル複雑度項によって制限されることを示し、DGがバイアス・バリアンスのトレードオフに類似した関係にあり得ることを示している。
- ドメイン単位の交差検証は、RotatedMNIST、PACS、VLCS、OfficeHome、Terra Incognitaを含むすべてのデータセットで、インスタンス単位の検証よりも強い正則化(低いC)を一貫して選択し、より高い精度を達成した。
- DINO特徴量では、ドメイン単位の検証がVLCSでlog C = -1.04のとき80.4%の精度を達成したのに対し、インスタンス単位の検証ではlog C = -0.87のとき80.5%であった。これは、より強い正則化によるより優れた一般化を示している。
- SVIROでは、ドメイン単位の検証がlog C = 0.21のとき97.2%の精度を達成したのに対し、インスタンス単位の検証はlog C = 4.85のとき95.3%であった。強い正則化下でも一貫した優位性が示された。
- SOTA DG手法の性能ばらつきは、主にその内蔵的または明示的なモデル複雑度の制御によって説明可能であり、アーキテクチャ的革新だけでは説明できない。
- 結果はGulrajani & Lopez-Paz (2021)の報告とは矛盾しており、これは深層ニューラルネットワークにおけるハイパーパrameterチューニングの不正確さと確率的性質が原因であると説明している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。