Skip to main content
QUICK REVIEW

[論文レビュー] Stochastic Downsampling for Cost-Adjustable Inference and Improved Regularization in Convolutional Networks

Jason Kuen, Xiangfei Kong|arXiv (Cornell University)|Jan 29, 2018
Advanced Neural Network Applications参考文献 35被引用数 6
ひとこと要約

本論文では、トレーニング中に異なるレイヤーとダウンサンプリング比をランダムに適用することで、コスト調整可能な推論と改善された正則化を実現する、Stochastic Downsampling Point (SDPoint) を提案する。SDPoint により、1つのモデルが複数の推論コストをサポート可能となり、設定間でパラメータを共有するため、一般化性能が向上し、従来の手法と比較してより低い FLOP バジェットで最先端の精度を達成できる。

ABSTRACT

It is desirable to train convolutional networks (CNNs) to run more efficiently during inference. In many cases however, the computational budget that the system has for inference cannot be known beforehand during training, or the inference budget is dependent on the changing real-time resource availability. Thus, it is inadequate to train just inference-efficient CNNs, whose inference costs are not adjustable and cannot adapt to varied inference budgets. We propose a novel approach for cost-adjustable inference in CNNs - Stochastic Downsampling Point (SDPoint). During training, SDPoint applies feature map downsampling to a random point in the layer hierarchy, with a random downsampling ratio. The different stochastic downsampling configurations known as SDPoint instances (of the same model) have computational costs different from each other, while being trained to minimize the same prediction loss. Sharing network parameters across different instances provides significant regularization boost. During inference, one may handpick a SDPoint instance that best fits the inference budget. The effectiveness of SDPoint, as both a cost-adjustable inference approach and a regularizer, is validated through extensive experiments on image classification.

研究の動機と目的

  • リアルタイムでリソース制約のあるシステムにおいて、変動する推論バジェットに適応可能な CNN のトレーニングの課題に対処すること。
  • 再トレーニングなしで、1つのモデルが複数の推論コストをサポートできる手法を開発すること。
  • トレーニング中に多様なダウンサンプリング設定を介してパラメータ共有を実現し、モデルの正則化を向上させること。
  • レイヤーまたはパラメータをスキップする手法とは異なり、低コスト推論時にもネットワークのパラメータをフルに活用できること。

提案手法

  • トレーニング中、各イテレーションごとに、ダウンサンプリング層のインデックスと比からなるランダムな SDPoint インスタンスが選択され、特徴マップの空間的サイズが小さくなる。
  • ダウンサンプリングは中間特徴マップに適用され、計算コスト(FLOPs)が削減される一方で、すべてのインスタンスで共有されたネットワーク重みを維持する。
  • すべての SDPoint インスタンスは同じ予測損失を最小化するようにトレーニングされ、パラメータ共有が正則化を強化する。
  • 推論時、利用可能な計算バジェットに基づいて、特定の SDPoint インスタンスを決定的に選択する。
  • この手法はアーキテクチャに依存せず、追加のパラメータやトレーニングオーバーヘッドを追加しない。
  • ダウンサンプリングのポイントと比における確率的要因を活用することで、スケール不変性とロバストネスが向上する。

実験結果

リサーチクエスチョン

  • RQ1再トレーニングなしで、確率的ダウンサンプリングを用いて1つの CNN が複数の推論コストをサポートできるか?
  • RQ2多様なダウンサンプリング設定にわたるパラメータ共有が、モデルの正則化と一般化をどのように向上させるか?
  • RQ3中間特徴マップのダウンサンプリングは、ネットワークのレイヤーをスキップするのと比較して、低コスト推論時においてより有用な情報を保持するか?
  • RQ4ベースラインモデルと比較して、SDPoint は CNN のスケール感受性をどの程度向上させるか?
  • RQ5既存の手法と比較して、SDPoint は顕著に低い FLOP コストで最先端の精度を達成できるか?

主な発見

  • ResNeXt-d101-c32 のトップ-1検証誤差を 20.4%、トップ-5誤差を 5.3% まで低下させ、FLOP の約2倍の値で最先端のモデルと同等の精度を達成した。
  • PreResNet-d101 の SDPoint インスタンスは、SACT と同等の精度を、FLOPs の 69% のみで達成し、コスト-精度効率に優れた性能を示した。
  • SDPoint を搭載したモデルは、プリクローピングサイズ間の平均ペairワイズコサイン類似度が 0.961 であったのに対し、ベースラインは 0.944 であった。これは、スケール不変性の向上を示している。
  • 0.5 のダウンサンプリング比を削除するか、交互にブロックを適用すると性能が低下するため、正則化に確率的要因の重要性が確認された。
  • 高い FLOPs 必要な困難な ImageNet 例(例:16.0 GFLOPs)は、しばしばサイズ優位の干渉要因を含んでおり、早期のダウンサンプリングが精度を損なう可能性があることが示唆された。
  • SDPoint により、コストと精度の最適なトレードオフを持つサブネットワークの特定が可能となり、必要な推論コストに基づいて分類の難易度順に例をソートできるようになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。