Skip to main content
QUICK REVIEW

[論文レビュー] Visual Representation Learning Does Not Generalize Strongly Within the Same Domain

Lukas Schott, Julius von Kügelgen|arXiv (Cornell University)|Jul 17, 2021
Generative Adversarial Networks and Image Synthesis被引用数 8
ひとこと要約

本論文は、同じドメイン内における要因の変動の分布外(OOD)変化に、視覚的表現学習手法が一般化できるかを調査する。制御されたデータセット(dSprites、Shapes3D、MPI3D、および新規のCelebGlowデータセット)を用いて、17種類の表現学習アプローチを、合成、補間、外挿のベンチマークで評価した。主な発見は、すべてのモデルが真の生成メカニズムを学習できず、イン-distribution性能が高くても、同じドメイン内でも一般化が著しく劣ることである。

ABSTRACT

An important component for generalization in machine learning is to uncover underlying latent factors of variation as well as the mechanism through which each factor acts in the world. In this paper, we test whether 17 unsupervised, weakly supervised, and fully supervised representation learning approaches correctly infer the generative factors of variation in simple datasets (dSprites, Shapes3D, MPI3D) from controlled environments, and on our contributed CelebGlow dataset. In contrast to prior robustness work that introduces novel factors of variation during test time, such as blur or other (un)structured noise, we here recompose, interpolate, or extrapolate only existing factors of variation from the training data set (e.g., small and medium-sized objects during training and large objects during testing). Models that learn the correct mechanism should be able to generalize to this benchmark. In total, we train and test 2000+ models and observe that all of them struggle to learn the underlying mechanism regardless of supervision signal and architectural bias. Moreover, the generalization capabilities of all tested models drop significantly as we move from artificial datasets towards more realistic real-world datasets. Despite their inability to identify the correct mechanism, the models are quite modular as their ability to infer other in-distribution factors remains fairly stable, providing only a single factor is out-of-distribution. These results point to an important yet understudied problem of learning mechanistic models of observations that can facilitate generalization.

研究の動機と目的

  • 表現学習モデルが、ドメイン内での同じ要因の変動に対する分布外(OOD)変化に一般化できるかを評価すること。
  • モデルが真の生成メカニズムを学習しているのか、それとも誤った統計的相関に依存しているのかを調査すること。
  • 教師信号の種別(教師なし、弱教師あり、完全教師あり)およびアーキテクチャの影響が、イン-distribution一般化に与える影響を評価すること。
  • 顔貌要因(例:年齢、笑顔、髪の色)が現実的である新規ベンチマークデータセット、CelebGlowを提供すること。
  • 機械的表現学習の今後の研究を導くために、標準化されたベンチマーク、評価スクリプト、およびリーダーボードを提供すること。

提案手法

  • 著者らは、要因の変動(例:サイズ、形状、色)が独立して制御可能な制御されたデータセットを用いて、系統的なOODテスト分割(合成、補間、外挿)を設計した。
  • VAE、GAN、MLP、CNN、ResNet、およびCoordConv やSpatial Transformer などの特化型アーキテクチャを含む17種類の表現学習アプローチにおいて、2000以上のモデルを訓練・評価した。
  • OOD条件下での分離要因の予測精度を測る指標としてR²スコアを用い、高いスコアは未観測の要因組み合わせへの一般化が良好であることを示す。
  • 事前学習済みのGlowモデルをCeleb-HQデータセットに適用した潜在変数の走査により、現実的な顔貌属性変動を可能にする新規データセットCelebGlowを構築した。
  • ベンチマークはすべての可能な要因の組み合わせを含み、GitHubに評価スクリプトとリーダーボードを公開し、再現性とコミュニティ間の比較を可能にした。

実験結果

リサーチクエスチョン

  • RQ1表現学習モデルは、同じドメイン内での同じ要因の変動に対する分布外の組み合わせに一般化できるか?
  • RQ2教師信号の種別(教師なし、弱教師あり、完全教師あり)が異なるモデルは、真の生成メカニズムを学習しているのか、それとも誤った相関に依存しているのか?
  • RQ3人工データセットからより現実的な実世界データセットに移行する際、モデルの一般化性能はどの程度劣化するか?
  • RQ41つの要因のみがOODの場合、モデルの予測はどの程度モジュラーであるか?
  • RQ5変換不変性や座標ベース特徴など、アーキテクチャのインダクティブバイアスは、イン-distribution一般化を改善できるか?

主な発見

  • 教師信号やアーキテクチャにかかわらず、テストされたすべてのモデルがOOD要因の組み合わせに対して一般化が著しく劣り、合成、補間、外挿の各タスクでR²スコアが著しく低下した。
  • dSpritesデータセットでは、最高性能を示したモデル(ResNet101)でも外挿タスクで67.8±1.7のR²にとどまり、未観測の要因値の推論能力が限定的であることが示された。
  • より現実的なCelebGlowデータセットでは、トップモデル(ResNet101 ImageNet-21k)で外挿タスクで41.6±8.5のR²にとどまり、イン-distribution性能に比べて著しい性能低下が確認された。
  • モデルは強いモジュラリティを示した:1つの要因のみがOODの場合、イン-distribution要因の予測は正確なままであり、孤立した分布シフトに対しては耐性があることが示された。
  • 人工データセット(例:dSprites)と実世界データセット(例:CelebGlow)との間で性能格差は顕著であり、複雑で現実的なデータではモデルの失敗が顕著に顕在した。
  • 最先端モデル(例:Rotation-EQ-big、Spatial Transformers)ですら、外挿能力に限界があり、多数のベンチマークでR²スコアが70未満にとどまり、メカニズム学習における根本的な制限が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。