Skip to main content
QUICK REVIEW

[論文レビュー] A High-Performance Adaptive Quantization Approach for Edge CNN Applications

Hsu-Hsun Chin, Ren‐Song Tsay|arXiv (Cornell University)|Jul 18, 2021
Infrared Target Detection Methodologies参考文献 54被引用数 4
ひとこと要約

本論文では、エッジ最適化畳み込みニューラルネットワーク(CNN)におけるバイアス付き活性化による精度損失を軽減するため、4ビット整数推論においてスケーリングおよびシフト要因を動的に調整する自己適応量子化手法を提案する。ImageNet、COCO、PTBベンチマークで評価された結果、最先端の精度を達成しており、一部のケースではフル精度モデルをも上回っている。同時に、極めてリソース制約の厳しいエッジデバイスへのデプロイも可能である。

ABSTRACT

Recent convolutional neural network (CNN) development continues to advance the state-of-the-art model accuracy for various applications. However, the enhanced accuracy comes at the cost of substantial memory bandwidth and storage requirements and demanding computational resources. Although in the past the quantization methods have effectively reduced the deployment cost for edge devices, it suffers from significant information loss when processing the biased activations of contemporary CNNs. In this paper, we hence introduce an adaptive high-performance quantization method to resolve the issue of biased activation by dynamically adjusting the scaling and shifting factors based on the task loss. Our proposed method has been extensively evaluated on image classification models (ResNet-18/34/50, MobileNet-V2, EfficientNet-B0) with ImageNet dataset, object detection model (YOLO-V4) with COCO dataset, and language models with PTB dataset. The results show that our 4-bit integer (INT4) quantization models achieve better accuracy than the state-of-the-art 4-bit models, and in some cases, even surpass the golden full-precision models. The final designs have been successfully deployed onto extremely resource-constrained edge devices for many practical applications.

研究の動機と目的

  • 量子化されたエッジCNNにおけるバイアス付き活性化が引き起こす顕著な精度低下を是正すること。
  • モデル性能を損なわず、エッジデプロイにおけるメモリ帯域幅と計算コストを低減すること。
  • トレーニング中にタスク固有損失に応じて適応的に変化する量子化戦略を開発すること。
  • 極めてリソース制約の厳しいエッジデバイス上でも高精度な4ビット推論を可能にすること。
  • 既存の4ビット量子化手法を上回り、一部のケースではフル精度モデルをも上回ること。

提案手法

  • 本手法は、タスク損失フィードバックに基づき、トレーニング中にスケーリングおよびシフト要因を動的に調整する。
  • 勾配ベース最適化を用いて、各層ごとに適応可能な学習可能な量子化関数を導入する。
  • 活性化分布の特性を保持するために、非一様かつ非対称な量子化スキームを採用する。
  • スケーリングおよびシフトパラメータは、ファインチューニング中にタスク損失を最小化するようにバックプロパゲーションにより更新される。
  • 本手法は、ポストトレーニング量子化およびファインチューニングの両方で適用可能であり、標準的なCNNアーキテクチャと互換性を保つ。
  • 評価は複数のモデル(ResNet、MobileNet-V2、EfficientNet-B0、YOLO-V4、PTB上の言語モデル)を対象として実施された。

実験結果

リサーチクエスチョン

  • RQ14ビット量子化されたエッジCNNにおける精度損失を、量子化パラメータの動的調整によって低減できるか?
  • RQ2タスク損失に基づく自己適応的スケーリングおよびシフトと、固定された量子化スキームとを比較した場合、どちらが優れているか?
  • RQ34ビット量子化モデルは、フル精度モデルと同等またはそれ以上の精度を達成できるか?
  • RQ4この手法は、極めてリソース制約の厳しいエッジデバイスへのデプロイにどの程度対応できるか?
  • RQ5自己適応的量子化手法は、多様なCNNアーキテクチャおよびタスクに一般化可能か?

主な発見

  • 提案手法の4ビット量子化は、ImageNetにおける最先端の4ビット量子化ベースラインを上回るトップ-1精度を達成した。
  • いくつかのケースでは、4ビットモデルがそれに対応するフル精度モデルの精度を上回っており、特にResNet-18およびMobileNet-V2で顕著であった。
  • 画像分類、物体検出(COCOにおけるYOLO-V4)、言語モデリング(PTB)という多様なタスクにおいて、高い性能を維持した。
  • 最終的な量子化モデルは、極めてリソース制約の厳しいエッジデバイスに正常にデプロイされ、実用的妥当性が確認された。
  • バイアス付き活性化からの情報損失を顕著に低減するため、スケーリングおよびシフト要因の自己適応的調整が、特に深く近代的なCNNで有効であった。
  • 本手法は、多数のネットワークアーキテクチャおよびデータセットにおいて、頑健性と一般化能力を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。