Skip to main content
QUICK REVIEW

[論文レビュー] Finding the Task-Optimal Low-Bit Sub-Distribution in Deep Neural Networks

Runpei Dong, Zhanhong Tan|arXiv (Cornell University)|Dec 30, 2021
Advanced Neural Network Applications被引用数 4
ひとこと要約

本稿では、重みとコアのガウス混合近似を一括して最適化することで、深層ニューラルネットワーク内にタスク最適な低ビット部分分布を自動で学習する、微分可能ガウス混合重み共有手法DGMSを提案する。ELBO や手動による設定に依存せず、タスク目的関数を直接最適化することで、7.46倍の推論速度向上(モバイルCPUで)と、ドメイン間で強いゼロショット転送性を実現する最先端の量子化性能を達成する。

ABSTRACT

Quantized neural networks typically require smaller memory footprints and lower computation complexity, which is crucial for efficient deployment. However, quantization inevitably leads to a distribution divergence from the original network, which generally degrades the performance. To tackle this issue, massive efforts have been made, but most existing approaches lack statistical considerations and depend on several manual configurations. In this paper, we present an adaptive-mapping quantization method to learn an optimal latent sub-distribution that is inherent within models and smoothly approximated with a concrete Gaussian Mixture (GM). In particular, the network weights are projected in compliance with the GM-approximated sub-distribution. This sub-distribution evolves along with the weight update in a co-tuning schema guided by the direct task-objective optimization. Sufficient experiments on image classification and object detection over various modern architectures demonstrate the effectiveness, generalization property, and transferability of the proposed method. Besides, an efficient deployment flow for the mobile CPU is developed, achieving up to 7.46$ imes$ inference acceleration on an octa-core ARM CPU. Our codes have been publicly released at \url{https://github.com/RunpeiDong/DGMS}.

研究の動機と目的

  • 低ビット重み量子化における分布のずれが引き起こす性能低下を解消すること。
  • 量子化における手動によるハイパーパramータチューニングを排除し、最適な部分分布を自動で学習すること。
  • 異なるビジョンドメインにわたる量子化モデルの汎化性と転送性を向上させること。
  • スムーズな推論パイプラインを提供することで、モバイルCPU上での効率的デプロイを可能とすること。
  • 固定事前分布やELBO目的関数に依存せず、モデル固有の部分分布を学習することで、量子化をタスク最適化問題として再定式化すること。

提案手法

  • 潜在的な低ビット部分分布をモデル化するため、固定されたデルタ関数事後分布に代わって微分可能なガウス混合(GM)近似を導入する。
  • タスク損失を直接最小化することで、ネットワーク重みとGMパラメータをエンドツーエンドで同時に最適化し、ELBO最適化の必要性を回避する。
  • 温度に基づくソフトマックス再パラメトリゼーションを用いて、量子化プロセスにおける学習と推論のギャップを埋める。
  • 訓練中に重みをGM近似部分分布上に射影することで、滑らかで微分可能な量子化を実現する。
  • GMが重みの更新に応じて自己適応的に進化する自動化スキームを採用し、手動設定を排除する。
  • 並列性を維持し、キャッシュアクセスを最適化することで、モバイルCPU上での効率的な量子化モデルデプロイを実現する。

実験結果

リサーチクエスチョン

  • RQ1手動によるハイパーパramータチューニングを一切行わず、モデル固有のタスク最適な低ビット部分分布を自動で発見できるか?
  • RQ2タスク目的関数を直接最適化することで、ELBOに基づく変分推論に比べてより優れた量子化性能が得られるか?
  • RQ3学習された部分分布は、画像分類や物体検出など、異なるビジョンドメインにわたって汎化可能で、ゼロショット転送が可能か?
  • RQ4画像分類および物体検出タスクにおいて、最小限の精度低下で高い圧縮率を達成できるか?
  • RQ5精度を損なわずに、モバイルCPU上での推論をどの程度高速化できるか?

主な発見

  • オクタコアARM CPU上では、全精度モデルと比較して、DGMSが最大7.46倍の推論速度向上を達成し、精度の低下は最小限に抑えられる。
  • CIFAR-10では、4ビットのDGMSがResNet-20で70.25%のトップ1精度を達成し、一部のケースで全精度ベースラインを上回る。
  • ゼロショット転送では、CUB-200-2011で77.46%、Stanford Carsで81.46%のトップ1精度を達成し、全精度モデルと同等の性能を示す。
  • ImageNet上で1回のファインチューニングエポックのみで、DGMSは82.28%のトップ1精度に到達し、全精度性能と一致する。
  • 学習された部分分布は強力なドメイン不変性を示し、多様なデータセット間で効果的なゼロショット量子化を可能にする。
  • 訓練中に精度向上と相関するが、訓練目的として使用されていないにもかかわらず、量子化誤差(MSEで測定)が自然に減少する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。