Skip to main content
QUICK REVIEW

[論文レビュー] Drop-Activation: Implicit Parameter Reduction and Harmonic Regularization

Senwei Liang, Yuehaw Khoo|arXiv (Cornell University)|Nov 14, 2018
Advanced Neural Network Applications参考文献 30被引用数 5
ひとこと要約

この論文は、トレーニング中にReLU活性化関数をランダムに恒等写像に置き換えることで、暗黙的にモデルパラメータを削減し一般化性能を向上させる、新しい正則化手法であるDrop-Activationを紹介する。この手法はバッチ正則化と互換性を保ち、推論の複雑さを増さずにCIFAR-10、CIFAR-100、SVHN、EMNIST、ImageNetのベンチマークにおいて一貫してテスト精度を向上させる。

ABSTRACT

Overfitting frequently occurs in deep learning. In this paper, we propose a novel regularization method called Drop-Activation to reduce overfitting and improve generalization. The key idea is to drop nonlinear activation functions by setting them to be identity functions randomly during training time. During testing, we use a deterministic network with a new activation function to encode the average effect of dropping activations randomly. Our theoretical analyses support the regularization effect of Drop-Activation as implicit parameter reduction and verify its capability to be used together with Batch Normalization (Ioffe and Szegedy 2015). The experimental results on CIFAR-10, CIFAR-100, SVHN, EMNIST, and ImageNet show that Drop-Activation generally improves the performance of popular neural network architectures for the image classification task. Furthermore, as a regularizer Drop-Activation can be used in harmony with standard training and regularization techniques such as Batch Normalization and Auto Augment (Cubuk et al. 2019). The code is available at \url{https://github.com/LeungSamWai/Drop-Activation}.

研究の動機と目的

  • 訓練データサイズに比べてモデル容量が大きい場合の深層ニューラルネットワークにおける過学習を解消すること。
  • アーキテクチャの変更なしに有効パrameter数を暗黙的に削減する正則化技術を開発すること。
  • バッチ正則化やデータオーグメンテーションなどの既存のトレーニング手法と互換性を保つこと。
  • 画像分類において多様なアーキテクチャとデータセットで一貫した性能向上を示すこと。
  • 暗黙的なパrameter削減と分散安定性を通じて、正則化効果の理論的裏付けを提供すること。

提案手法

  • 固定確率でトレーニング中にReLU活性化関数を恒等写像に置き換えることで、ランダムに非線形性を無効化する。
  • 各ネットワークが非線形性をランダムに有効・無効化する確率的ネットワークのアンサンブルを学習する。
  • 推論時、ドロップされた非線形性と保持された非線形性の平均効果を組み合わせた新しい活性化関数を備えた決定的ネットワークを使用する。
  • 導出された活性化関数は、ベルヌーイドロップアウトの期待値から得られる恒等関数とReLU関数の凸結合である。
  • 理論的分析により、Drop-Activationは非線形と線形のネットワーク挙動の差を暗黙的にペナルティ化し、より単純で一般化可能なモデルを促進することが示される。
  • トレーニングと推論で活性化分散が一貫するため、バッチ正則化の統計的性質を保ち、BNと連携可能である。

実験結果

リサーチクエスチョン

  • RQ1トレーニング中に非線形活性化関数をランダムにドロップすることで、深層ネットワークの一般化性能が向上するか?
  • RQ2Drop-Activationは有効パrameter数を暗黙的に削減するのか? もしそうであれば、モデル容量と過学習にどのように影響するか?
  • RQ3Drop-Activationはバッチ正則化と効果的に組み合わせられるか? その統計的性質を損なわないか?
  • RQ4Cutout や AutoAugment などの他の正則化技術と組み合わせた場合、Drop-Activationの性能はどのようになるか?
  • RQ5標準ベンチマークを越えて、異なるアーキテクチャやデータセットにおいても本手法は汎用性を示せるか?

主な発見

  • CIFAR-10およびCIFAR-100では、Drop-Activationが一貫してテスト精度を向上させ、ベースラインモデル比で誤差率を最大1.5%まで低減した。
  • SVHNおよびEMNISTでは、ResNet、WideResNet、DenseNetなど複数のアーキテクチャでテスト誤差が0.1–0.3%低下した。
  • ImageNetでは、ResNet34でトップ1バリデーション誤差が0.22%低下し、SE-ResNet50では0.21%低下した。これは大規模スケールでも有効であることを示している。
  • AutoAugment や Cutout と組み合わせた場合、さらにテスト誤差が低減した。例えば、WideResNet28-10を用いたCIFAR-100では、AutoAugmentとDrop-Activationを併用することで1.84%の改善が得られた。
  • Drop-Activationは安定したバッチ統計を維持し、ドロップアウトとは異なりバッチ正則化とのシームレスな統合を可能にした。
  • 各活性化関数のランダムなベルヌーイサンプリングによるトレーニング時間の増加はわずかであり、管理可能な範囲にとどまった(例:WideResNet28-10では17.9%の増加)。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。