Skip to main content
QUICK REVIEW

[論文レビュー] Parameter Re-Initialization through Cyclical Batch Size Schedules

Norman Mu, Zhewei Yao|arXiv (Cornell University)|Dec 4, 2018
Adversarial Robustness in Machine Learning参考文献 26被引用数 5
ひとこと要約

本稿では、交互に大きなバッチサイズと小さなバッチサイズを切り替えることで制御されたノイズ注入により重みを再初期化する、周期的バッチサイズ(CBS)スケジュールを提案する。この手法により、言語モデリングのパープレキシティが最大7.91ポイント改善され、トレーニングイテレーションが最大61%削減される。また、追加コストを最小限に抑えつつ、効率的なアンサンブル学習や adversarial training も可能となる。

ABSTRACT

Optimal parameter initialization remains a crucial problem for neural network training. A poor weight initialization may take longer to train and/or converge to sub-optimal solutions. Here, we propose a method of weight re-initialization by repeated annealing and injection of noise in the training process. We implement this through a cyclical batch size schedule motivated by a Bayesian perspective of neural network training. We evaluate our methods through extensive experiments on tasks in language modeling, natural language inference, and image classification. We demonstrate the ability of our method to improve language modeling performance by up to 7.91 perplexity and reduce training iterations by up to $61\%$, in addition to its flexibility in enabling snapshot ensembling and use with adversarial training.

研究の動機と目的

  • 深層ニューラルネットワークにおける最適でない重み初期化の課題に対処すること。これは、収束性や一般化性能の低下を引き起こす可能性がある。
  • トレーニング中にノイズレベルを動的に調整する適応的初期化戦略を検討すること。バッチサイズを制御パラメータとして用いる。
  • 言語モデリング、NLP、画像分類を含む多様なタスクにおいて、トレーニングの効率性とモデル性能を向上させること。
  • 追加のトレーニングコストなしに、スナップショットアンサンブルや adversarial training といった高度な技術と柔軟に統合できること。
  • 一般化性能の向上と悪くない局所的最小値からの脱出を促進する、ベイジアンにインspiredされた動的再初期化フレームワークを提供すること。

提案手法

  • 本手法は、確率的勾配降下法(SGD)におけるノイズレベルを周期的バッチサイズスケジュールで制御し、制御された温度変動を通じてベイジアン的適応的事前分布を模倣する。
  • SGDにおけるノイズは、学習率とバッチサイズの比に依存する。バッチサイズを周期的に変更することで、学習率を変更せずにノイズスケールを動的に変更する。
  • 本手法は、確率微分方程式のEuler-Maruyama離散化に基づくものであり、バッチサイズが探索を制御する温度のスイッチとして機能する。
  • LSTM、ResNet、WResNetなどのアーキテクチャを用いて、言語モデリングや画像分類などのタスクで、さまざまな周期的スケジュール(例:CBS-10-3、CBS-15-2)を評価した。
  • サイクルのピークでモデルを保存することで、スナップショットアンサンブルを可能にし、追加のトレーニングコストなしにアンサンブル性能を達成した。
  • アドバーシャル正則化と組み合わせることで、特に画像分類において、より高い耐性と精度を実現した。

実験結果

リサーチクエスチョン

  • RQ1固定バッチサイズベースラインと比較して、周期的バッチサイズスケジューリングはニューラルネットワークトレーニングの一般化性能を向上させることができるか?
  • RQ2CBSスケジュールは、モデルの精度を維持または向上させつつ、どの程度トレーニングイテレーションを削減できるか?
  • RQ3重み初期化が不良または最適でない状況下で、CBSはどの程度の性能を示すか?
  • RQ4スナップショットアンサンブルおよびアドバーシャルトレーニングと効果的に組み合わせられ、モデル性能を向上させることができるか?
  • RQ5CBSを適応的事前分布の精錬と見なすベイジアン解釈が、損失関数と一般化性能の測定可能な向上をもたらすか?

主な発見

  • 画像分類タスクにおいて、CBSスケジュールは最大61%のトレーニングイテレーション削減を達成し、実行時間を顕著に短縮した。
  • 言語モデリングでは、ベースラインモデルと比較して、パープレキシティが最大7.91ポイント改善された。
  • 自然言語推論および画像分類において、CBSはわずかだが一貫した精度向上をもたらした。
  • 異なるCBSサイクルからのモデルを用いたスナップショットアンサンブルにより、ImageNetにおける画像分類精度は76.401%に向上した。これはベースライントレーニングの75.336%から上昇した。
  • CBSとアドバーシャルトレーニングを組み合わせることで、ImageNetでは追加で0.26%の精度向上が得られた。
  • 不良な初期重みを用いても、CBSはベースライン初期化を上回る性能を示し、最適でない初期化に対して高いロバストネスを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。