Skip to main content
QUICK REVIEW

[論文レビュー] Learning Anytime Predictions in Neural Networks via Adaptive Loss Balancing

Hanzhang Hu, Debadeepta Dey|arXiv (Cornell University)|Aug 22, 2017
Adversarial Robustness in Machine Learning参考文献 42被引用数 14
ひとこと要約

本稿では、訓練中に補助損失の重みを逆に比例させるように適応的にバランスさせるAdaLossという手法を提案する。この手法により、小さい任意のニューラルネットワーク(ANN)が固定重みを持つ大きなモデルと同等またはそれ以上の精度を達成でき、複数のビジョンデータセットで、特に性能の飽和状態にある際でも、初期および最終予測において競争力のある性能を発揮する。

ABSTRACT

This work considers the trade-off between accuracy and test-time computational cost of deep neural networks (DNNs) via \emph{anytime} predictions from auxiliary predictions. Specifically, we optimize auxiliary losses jointly in an \emph{adaptive} weighted sum, where the weights are inversely proportional to average of each loss. Intuitively, this balances the losses to have the same scale. We demonstrate theoretical considerations that motivate this approach from multiple viewpoints, including connecting it to optimizing the geometric mean of the expectation of each loss, an objective that ignores the scale of losses. Experimentally, the adaptive weights induce more competitive anytime predictions on multiple recognition data-sets and models than non-adaptive approaches including weighing all losses equally. In particular, anytime neural networks (ANNs) can achieve the same accuracy faster using adaptive weights on a small network than using static constant weights on a large one. For problems with high performance saturation, we also show a sequence of exponentially deepening ANNscan achieve near-optimal anytime results at any budget, at the cost of a const fraction of extra computation.

研究の動機と目的

  • 深層ニューラルネットワークにおける推論時の計算コストと予測精度のトレードオフを解消すること。
  • 初期および最終予測の両方の性能を向上させるために、補助損失を最適化する方法として、バランスの取れたアプローチを用いること。
  • 小さなANNが非適応的重みを持つ大きなモデルと同等の性能を達成できるようにする訓練戦略を開発すること。
  • 相対的な損失改善を等しく扱うという観点から、適応的損失重み付けの理論的裏付けを提供すること。
  • 適応的重み付けがデータセットの難易度に自動的に適応し、より難しいタスクでは後段の層に重みを集中させることを示すこと。

提案手法

  • 訓練中に補助損失の重み付き和を適応的に使用し、各損失の重みはその訓練セット上での経験的平均の逆数に比例する。
  • この正規化により、すべての損失が比較可能なスケールに保たれ、特定の損失が最適化を支配するのを防ぐ。
  • 理論的には、期待損失の幾何平均を最大化するのと同等であり、損失間の相対的改善を等しく扱う。
  • また、自明なゼロ重み解を避けるために対数バリア正則化を用いた最尤推定にも基づく。
  • 標準的なDNNアーキテクチャに中間層に補助予測と損失を追加することで、ANNを構築する。
  • このフレームワークは、スタンドアロンのANNおよび指数的に深さが増すネットワークを組み合わせたアンサンブルベースの任意のネットワーク(EANN)の両方をサポートする。

実験結果

リサーチクエスチョン

  • RQ1適応的損失重み付けは、異なる計算リソース制約下でも、任意のニューラルネットワークの性能を向上させることができるか?
  • RQ2初期および最終予測精度において、適応的バランスと固定された定数重みの方法とを比較すると、どちらが優れているか?
  • RQ3適応的重みを用いた小さなANNは、非適応的重みを用いた大きなANNを上回ることができるか?
  • RQ4適応的重み付けスキームは、データセットの難易度に自動的に適応し、より難しいデータセットでは最終層に重みを集中させるか?
  • RQ5提案手法をアンサンブル戦略と組み合わせることで、さらに任意の予測性能を向上させることができるか?

主な発見

  • AdaLossで訓練された小さなANNは、非適応的重みを用いた大きなANNと同等の最終精度に達するが、各精度レベルに到達するまでの時間が短い。
  • CIFAR-100では、AdaLossを用いた小さなANNが固定重みの大きなANNを上回り、初期および最終予測の両方で優れた効率性を示した。
  • AdaLossにより、FLOPSが類似する条件下で、小さなDenseANN169が大きなMSDNet38と同等の最終誤差率を達成した。これは、コスト効率の向上を示している。
  • ILSVRCでは、AdaLossを用いたResANNを用いたEANNが、線形アンサンブルのResNetsおよびDenseNetsを上回り、最先端のMSDNetに近づいた。
  • 学習されたAdaLoss重みは、より難しいデータセット(例:CIFAR-100)では最終層に集中し、より簡単なデータセット(例:SVHN)ではより分散される傾向にあり、データ難易度への自動適応が示された。
  • 性能の飽和状態に達した際、AdaLossを用いたEANNは最終予測を遅らせるが、最適性能に近い水準を維持しており、このような状況下での戦略的優位性が示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。