Skip to main content
QUICK REVIEW

[論文レビュー] LieGG: Studying Learned Lie Group Generators

Artem Moskalev, Anna Sepliarskaia|arXiv (Cornell University)|Oct 9, 2022
Topological and Geometric Data Analysis被引用数 6
ひとこと要約

この論文では、微分可能なモデルと学習データから無限小のリー群生成子を計算することで、ニューラルネットワークが学習した対称性を抽出・分析する LieGG の手法を紹介する。深く過パラメータ化されたネットワークが微調整やレイヤー単位の学習を経て、特に中間層において、データに内在する対称性についての事前知識なしに、より正確で不変性の高い対称性を学習することが明らかになった。

ABSTRACT

Symmetries built into a neural network have appeared to be very beneficial for a wide range of tasks as it saves the data to learn them. We depart from the position that when symmetries are not built into a model a priori, it is advantageous for robust networks to learn symmetries directly from the data to fit a task function. In this paper, we present a method to extract symmetries learned by a neural network and to evaluate the degree to which a network is invariant to them. With our method, we are able to explicitly retrieve learned invariances in a form of the generators of corresponding Lie-groups without prior knowledge of symmetries in the data. We use the proposed method to study how symmetrical properties depend on a neural network's parameterization and configuration. We found that the ability of a network to learn symmetries generalizes over a range of architectures. However, the quality of learned symmetries depends on the depth and the number of parameters.

研究の動機と目的

  • データの背後にある対称性群についての事前知識なしに、ニューラルネットワークが学習した対称性を特定する手法を開発すること。
  • 対称性分散とバイアスといった定量的指標を用いて、学習された対称性の質と不変性を評価すること。
  • ネットワークの深さ、幅、および学習方針が、学習された対称性の正確性と耐障害性に与える影響を調査すること。
  • 訓練中に暗黙的に習得される幾何学的インダクティブバイアスを明らかにすることで、モデルの解釈性を向上させること。

提案手法

  • ネットワークのデータ変換に関する勾配から導かれる行列の核空間方程式を解き、学習されたリー群の無限小生成子を抽出する。
  • リー代数とリー群の対応関係を活用して、生成子を指数写像により拡張し、連続的な対称性変換を回復する。
  • 生成子の偏極行列から対称性分散と対称性バイアスを計算し、不変性の質を定量化する。
  • 回転MNISTやその他の要因の変動を制御したデータセットに、順伝播ネットワークを訓練して適用する。
  • 事前学習、微調整、レイヤー単位の学習など、さまざまな学習方針の分析を可能にする。
  • 微分可能である限り一般に適用可能であり、任意のニューラルネットワークアーキテクチャに適用可能である。

実験結果

リサーチクエスチョン

  • RQ1ニューラルネットワークは、アーキテクチャ上のインダクティブバイアスなしに、データから連続的な対称性をどれほど学習するのか?
  • RQ2学習された対称性は、データに実際に存在する真の対称性をどれほど正確に反映しているのか?
  • RQ3ネットワークの深さやパラメータ数は、学習された対称性の正確性と不変性にどのように影響するのか?
  • RQ4微調整やレイヤー単位の学習といった異なる学習方針は、中間層の対称性学習にどのように影響するのか?
  • RQ5MLP やトランスフォーマーのようなモデルが学習する幾何学的インダクティブバイアスを、定量的に評価し解釈可能にすることができるか?

主な発見

  • より深く過パラメータ化されたネットワークは、小規模なアーキテクチャと比較して、より正確な対称性群と高い不変性を学習する。
  • 微調整やレイヤー単位の学習を経たネットワークの最終層および準最終層は、類似した対称性レベルに収束する。これは、タスク固有の最適な不変性対称性が存在することを示唆している。
  • 中間層では学習方針に強く依存する。微調整やレイヤー単位の学習により、対称性の正確性が向上し、対称性分散とバイアスの両方が低減される。
  • 事前学習済みサブネットワークは、より深いモデルに組み込まれた場合と比較して、より正確な対称性を学習する。これは、事前学習が対称性学習を促進することを示している。
  • 変換集合の事前知識なしに、学習された対称性の生成子を効果的に回復でき、不変性の質を定量的に評価可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。