[論文レビュー] Invariance Learning in Deep Neural Networks with Differentiable Laplace Approximations
この論文は、マージナル尤度のクラメロ・ファクタード・ラプラス近似を用いて、深層ニューラルネットワークにおけるデータオーグメンテーション不変性のエンドツーエンド学習のための微分可能ベイジアン手法を提案する。勾配降下法により検証データを必要とせずに不変性パラメータを最適化することで、汎化性能とデータ効率が向上し、標準的なオーグメンテーションと比較して、画像ベンチマークで最大10パーセンテージポイント高い精度と10倍のデータ効率を達成した。
Data augmentation is commonly applied to improve performance of deep learning by enforcing the knowledge that certain transformations on the input preserve the output. Currently, the data augmentation parameters are chosen by human effort and costly cross-validation, which makes it cumbersome to apply to new datasets. We develop a convenient gradient-based method for selecting the data augmentation without validation data during training of a deep neural network. Our approach relies on phrasing data augmentation as an invariance in the prior distribution on the functions of a neural network, which allows us to learn it using Bayesian model selection. This has been shown to work in Gaussian processes, but not yet for deep neural networks. We propose a differentiable Kronecker-factored Laplace approximation to the marginal likelihood as our objective, which can be optimised without human supervision or validation data. We show that our method can successfully recover invariances present in the data, and that this improves generalisation and data efficiency on image datasets.
研究の動機と目的
- 深層ニューラルネットワークにおけるデータオーグメンテーション変換の自動選択を実現し、手動のチューニングや交差検証への依存を排除すること。
- 検証データを必要とせずに、トレーニング中に回転、スケーリングなどの不変性パラメータを勾配ベースで最適化することを可能にすること。
- 微分可能でスケーラブルな方法でマージナル尤度を近似することで、ベイジアンモデル選択を深層ニューラルネットワークに拡張すること。
- データからタスク固有の不変性を直接学習することで、汎化性能とデータ効率を向上させること。
提案手法
- データオーグメンテーションを入力摂動上の事前分布として形式化し、変換された入力を平均化することで関数的不変性を強制する。
- 不変性事前分布を備えたベイジアンニューラルネットワークのマージナル尤度に対する微分可能でクラメロ分解されたラプラス近似を提案する。
- 再パrameterizationトリックを用いて不変性パラメータに関する確率的勾配を導出し、エンドツーエンド最適化を可能にする。
- 重みと不変性ハイパーパramータを同時に最適化することで、不変性パラメータの学習を標準的なニューラルネットワーク学習と統合する。
- スケーラブルなラプラス近似を用いてマージナル尤度を推定し、深層ネットワークにおける勾配ベースのベイジアンモデル選択を可能にする。
実験結果
リサーチクエスチョン
- RQ1深層ニューラルネットワークにおいて、回転やスケーリングなどの不変性パラメータを勾配ベースの最適化を用いてデータから自動的に学習できるか?
- RQ2マージナル尤度近似を用いた微分可能ベイジアンモデル選択は、手作業で設計されたオーグメンテーションと比較して、汎化性能とデータ効率を向上させるか?
- RQ3本手法は、検証データや人為的に指定されたハイパーパramータにアクセスせずに、意味のある不変性を学習できるか?
- RQ4画像分類タスクにおける、学習された不変性手法の性能は、標準的なデータオーグメンテーションベースラインと比較してどうか?
主な発見
- 標準的なデータオーグメンテーションと比較して、オリジナルのMNIST、Fashion-MNIST、CIFAR-10データセットで最大8〜10パーセンテージポイント高いテスト精度を達成した。
- 画像データセットのランダムサブセットにおいて、本手法は最大10倍のデータ効率を達成し、固定されたオーグメンテーションを用いたベースラインを著しく上回った。
- 可視化と軌道解析により、学習された不変性分布が回転やアフィン摂動といった意味のある変換を回復していることが確認された。
- 検証データやハイパーパramータチューニングを必要とせず、勾配を用いてエンドツーエンドで不変性パラメータを最適化することができた。
- クラメロ分解されたラプラス近似により、効率的で微分可能なマージナル尤度推定が可能となり、深層ネットワークにおけるベイジアンモデル選択が現実可能になった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。