Skip to main content
QUICK REVIEW

[論文レビュー] Synergy and Symmetry in Deep Learning: Interactions between the Data, Model, and Inference Algorithm

Lechao Xiao, Jeffrey Pennington|arXiv (Cornell University)|Jul 11, 2022
Domain Adaptation and Few-Shot Learning被引用数 4
ひとこと要約

本稿は、データ、モデル、推論アルゴリズムの相乗効果——特に対称性の整合性を通じて——が、深層学習が次元の呪いを克服できることを特定している。対称性がデータ、モデル、最適化アルゴリズムに整合している場合、データ量の増加に伴い学習効率が向上し、データ量のスケーリングがモデルの一般化性能を向上させる「データがデータ効率を向上させる(DIDE)効果」が明らかになった。

ABSTRACT

Although learning in high dimensions is commonly believed to suffer from the curse of dimensionality, modern machine learning methods often exhibit an astonishing power to tackle a wide range of challenging real-world learning problems without using abundant amounts of data. How exactly these methods break this curse remains a fundamental open question in the theory of deep learning. While previous efforts have investigated this question by studying the data (D), model (M), and inference algorithm (I) as independent modules, in this paper, we analyze the triplet (D, M, I) as an integrated system and identify important synergies that help mitigate the curse of dimensionality. We first study the basic symmetries associated with various learning algorithms (M, I), focusing on four prototypical architectures in deep learning: fully-connected networks (FCN), locally-connected networks (LCN), and convolutional networks with and without pooling (GAP/VEC). We find that learning is most efficient when these symmetries are compatible with those of the data distribution and that performance significantly deteriorates when any member of the (D, M, I) triplet is inconsistent or suboptimal.

研究の動機と目的

  • 高次元入力の下でも、現代の深層学習システムが次元の呪いをどのように乗り越えているかを理解すること。
  • データ、モデルアーキテクチャ、推論アルゴリズムにおける対称性が、学習効率の統一的原則として果たす役割を調査すること。
  • データ分布、モデルのインダクティブバイアス、最適化ダイナミクスの相互作用が、サンプル複雑性をどのように軽減するかを分析すること。
  • データ量の増加に伴い学習効率が向上する条件を特定し、古典的統計的学習境界に挑戦すること。

提案手法

  • 全結合ネットワーク(FCN)、局所結合ネットワーク(LCN)、ベクトル化された(VEC)およびグローバル平均プーリング(GAP)出力を持つ畳み込みネットワークという4つの代表的深層学習アーキテクチャを分析する。
  • 無限幅極限を用いて、モデルおよび推論アルゴリズムの対称性を研究し、インダクティブバイアスの取り扱い可能な理論的分析を可能にする。
  • データ分布の対称性(例:O(3)^d の回転対称性)、モデルの対称性、最適化によって生じるインダクティブバイアスの整合性を評価するための、対称性に基づくフレームワークを導入する。
  • 画像Netの入力を回転させるなどの対称性破壊摂動を加えた場合の学習曲線を実験的に評価し、データ効率を測定し、関数クラスの遷移を検出する。
  • 訓練データの増加に伴うスケーリング法則の勾配(α)の変化を測定することで、DIDE(データがデータ効率を向上させる)効果を定量化する。
  • 次元数の数え上げを用いて、O(3)^d や O(3d) などの偽の対称性を克服するために必要なトレーニングサンプル数を推定する。

実験結果

リサーチクエスチョン

  • RQ1データ、モデル、推論アルゴリズムにおける対称性が、高次元における深層学習の学習効率にどのように統合的に影響を与えるか?
  • RQ2訓練データの増加がデータ効率を向上させる条件は何か?その向上の原因は何か?
  • RQ3データ分布とモデルアーキテクチャの間の対称性整合性が一般化に果たす役割は何か?
  • RQ4深層学習システムは、O(3)^d のような偽の対称性を克服できるか?その場合、必要なサンプル数はどの程度か?
  • RQ5SGDの暗黙のバイアスが、モデルとデータの対称性とどのように作用し、一般化性能に影響を与えるか?

主な発見

  • 最適な学習システム(ImageNet に適用された ResNet101 と SGD)は、α ≈ 0.41 のべき乗則スケーリングを示し、高いデータ効率を示している。
  • データの対称性が破られた場合(例:O(3)^d による ImageNet の回転)、学習曲線に約 2×10⁵ 個のサンプルでくぼみ(cusp)が現れ、その以降にスケーリング勾配(α ≈ 0.49)が著しく向上する。
  • ResNet101 や Mixer などのモデルは、そのくぼみ以降の第二段階で α ≈ 0.49 および 0.38 を達成し、最適ベースラインの性能に近づく。
  • O(3)^d で回転させた ImageNet で学習させた際、ResNet ファミリーはトップ-1正解率の差を、ResNet-18 の約10% から ResNet-200 の約6% にまで縮小し、対称性破壊に対してより高い耐性を示す。
  • 同様の回転条件下で、EfficientNet ファミリーは、B0 の場合約4% の正解率差から、B7 では約1% にまで縮小し、より広く・深いモデルが偽の対称性をより効果的に克服できることを示している。
  • O(3)^d の対称性を克服するために必要なサンプル数は、推定で約10¹⁰ 個であり、その対称性群の次元数の数え上げと整合的である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。