Skip to main content
QUICK REVIEW

[論文レビュー] Loss Surface Simplexes for Mode Connecting Volumes and Fast Ensembling

Gregory W. Benton, Wesley J. Maddox|arXiv (Cornell University)|Feb 25, 2021
Model Reduction and Neural Networks参考文献 26被引用数 5
ひとこと要約

本稿では、深層ニューラルネットワークの損失関数の多様体において、低損失解の多次元単体的複体を発見するためのSimplicial Pointwise Random Optimization (SPRO) を提案する。これにより、事前学習モデルからわずか数エポックの追加学習で、Ensembled SPRO (ESPRO) を用いて高速なアンサンブルが可能になる。ESPRO は、深層アンサンブルと比較して、精度、キャリブレーション、データ分布のシフトに対するロバスト性において優れる。これは、幾何学的に定義された単体から多様で低損失のモデルを効率的にサンプリングすることで達成される。

ABSTRACT

With a better understanding of the loss surfaces for multilayer networks, we can build more robust and accurate training procedures. Recently it was discovered that independently trained SGD solutions can be connected along one-dimensional paths of near-constant training loss. In this paper, we show that there are mode-connecting simplicial complexes that form multi-dimensional manifolds of low loss, connecting many independently trained models. Inspired by this discovery, we show how to efficiently build simplicial complexes for fast ensembling, outperforming independently trained deep ensembles in accuracy, calibration, and robustness to dataset shift. Notably, our approach only requires a few training epochs to discover a low-loss simplex, starting from a pre-trained solution. Code is available at https://github.com/g-benton/loss-surface-simplexes.

研究の動機と目的

  • 孤立した極小値や1次元の接続経路を超えた、深層ニューラルネットワークの損失関数の多様体の幾何的構造を理解すること。
  • 多数の独立して学習されたモデルを接続する、多次元の低損失解の多様体(単体的複体)を同定すること。
  • 事前学習モデルから出発して、これらの低損失単体的複体を効率的に発見する手法を開発すること。
  • 発見された幾何的構造を活用し、より速く、より正確なアンサンブル手法を構築し、不確実性のキャリブレーションを向上させること。
  • 単体内でのサンプリングが、深層アンサンブルやベイジアンベースラインと比較して最先端の性能を達成できることを実証すること。

提案手法

  • SPRO は、事前学習モデルの周囲のパrameter空間において、低損失点を繰り返し探索することで単体的複体を構築する確率的最適化手法として提案される。
  • この手法は、ランダムウォークと損失評価を用いて、凸包内のすべての点で一様に低損失となるような頂点を同定する。
  • 単体的複体はその境界をなす頂点によって定義され、これにより単体の次元と体積を直接計算可能となる。
  • ESPRO は、発見された単体内部から一様にモデルパラメータをサンプリングすることでアンサンブルを生成し、多様性と低損失を保証する。
  • このアプローチは深層アンサンブルの即時置換として設計されており、事前学習後、わずか数エポックの追加学習で十分である。
  • 不確実性の定量は、単体上の予測分布を用いて行い、一様事前分布を仮定したベイジアンモデル平均に近似する。

実験結果

リサーチクエスチョン

  • RQ1複数の独立して学習されたモデルを1つの低損失領域で接続する多次元多様体が、損失関数の多様体に存在するか?
  • RQ2実用的な学習時間内で、このような高次元的・低損失の単体的複体を効率的に発見できるか?
  • RQ3これらの幾何的構造からのサンプリングが、標準的な深層アンサンブルと比較して、より良い一般化性能と不確実性キャリブレーションをもたらすか?
  • RQ4単体内からのサンプリングによって形成されたアンサンブルの性能は、データ分布のシフト下で、最先端のベイジアンおよびアンサンブル手法と比較してどうなるか?
  • RQ5損失関数の多様体の幾何的構造を活用することで、追加の学習なしにモデルのキャリブレーションとロバスト性を向上させられるか?

主な発見

  • 深層ニューラルネットワークの損失関数の多様体には、任意の数の独立して学習されたモデルを接続する、大規模で多次元的な低損失単体的複体が存在し、孤立した極小値や1次元の接続経路という従来の見方を覆すものである。
  • SPRO は、事前学習モデルからわずか数エポックの学習で、これらの低損失単体的複体を効率的に発見でき、高速かつスケーラブルな探索を可能にする。
  • 単体内部からサンプリングすることで形成されるESPROアンサンブルは、CIFAR-10 におけるガウスノイズ汚染下を含む、多数のベンチマークで標準的な深層アンサンブルを上回る高い精度を達成する。
  • ESPRO は、温度スケーリング後の期待キャリブレーション誤差(ECE)および負の対数尤度(NLL)が低く、MultiSWAG や MultiSWA よりも優れたキャリブレーションを示す。
  • 定性的な回帰タスクにおいて、ESPRO は深層アンサンブルや Izmailov et al. (2019) の最先端の部分空間法と比較して、欠損データのある領域でもよりキャリブレーションの良い不確実性帯を生成する。
  • 本手法は、さまざまなデータ分布のシフトのシナリオにおいても、ロバストな性能を示しており、分布シフトが一般的な実世界の展開において有効であることを確認している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。