Skip to main content
QUICK REVIEW

[論文レビュー] Rethinking Machine Learning Development and Deployment for Edge Devices

Liangzhen Lai, Naveen Suda|arXiv (Cornell University)|Jun 20, 2018
IoT and Edge/Fog Computing参考文献 18被引用数 9
ひとこと要約

この論文は、KERNALフレームワークと呼ばれる特別なフレームワークを用いて、モデルのトレーニングとインフェンスを再考することで、特にARM Cortex-M CPUを対象としたエッジデバイス向けに最適化された新しい機械学習開発およびデプロイメントパイプラインを提案する。8ビット整数形式で直接モデルをトレーニングし、カスタムオペレータを用いることで、デプロイメントの不一致を解消し、モデルサイズを最大75%まで削減するとともに、FP32モデルと比較して同等または優れた精度を維持する。これにより、リソース制約のあるハードウェア上で効率的で高品質なインフェンスが可能になる。

ABSTRACT

Machine learning (ML), especially deep learning is made possible by the availability of big data, enormous compute power and, often overlooked, development tools or frameworks. As the algorithms become mature and efficient, more and more ML inference is moving out of datacenters/cloud and deployed on edge devices. This model deployment process can be challenging as the deployment environment and requirements can be substantially different from those during model development. In this paper, we propose a new ML development and deployment approach that is specially designed and optimized for inference-only deployment on edge devices. We build a prototype and demonstrate that this approach can address all the deployment challenges and result in more efficient and high-quality solutions.

研究の動機と目的

  • 従来のフレームワークがデプロイメントの不一致を引き起こすため、リソース制約のあるエッジデバイスに機械学習モデルをデプロイする課題に対処すること。
  • ハイレベルなフレームワークでのモデル開発とエッジハードウェアでの効率的インフェンスのギャップを縮小するため、トレーニングとデプロイメントを1つの最適化されたパイプラインで統合すること。
  • 後処理量子化に依存せずに、低精度整数形式(例:8ビット非対称/対称量子化)でのエンドツーエンドのトレーニングとデプロイメントを可能にすることで、モデルの効率性と品質を向上させること。
  • MLフレームワークとインフェンスエンジンの間でオペレータの可用性や挙動の違いが原因となるデプロイメントのボトル neck を解消すること。
  • 適切な事前処理と最適化を組み合わせた場合に、直接低精度形式でトレーニングすることで、FP32モデルと同等またはそれ以上の精度を持つモデルを生成できることを示すこと。

提案手法

  • 8ビット整数演算とカスタム量子化オペレータをネイティブにサポートするフレームワーク(KANJI)を用いて、トレーニングとデプロイメントを1つのフレームワークで統合した新しいML開発およびデプロイメントパイプラインを提案する。
  • 後処理量子化を必要としないように、初期段階から量子化オペレータを用いて8ビットインフェンスを直接最適化する、革新的なトレーニングプロセスを導入する。
  • Winograd畳み込みや量子化行列乗算などの特殊な低精度演算をサポートする、カスタムオペレータ実装スタック(例:CMSIS-NN)を採用する。
  • トレーニンググラフからデプロイドインフェンスグラフへ直接マッピングできる統一されたモデル表現を用いることで、中間変換ステップを排除し、モデルの挙動を保持する。
  • 精度向上のため、画像ごとの標準化やバッチ正規化に類似した正規化などの入力事前処理技術を適用する。
  • 事前学習済みのFP32モデルをKANJIフレームワークで再ターゲティングし、微調整することで、量子化後の精度損失を回復させるハイブリッドトレーニング戦略に依存する。

実験結果

リサーチクエスチョン

  • RQ1エッジデバイスにデプロイされた場合に、8ビット整数形式で直接ディープニューラルネットワークをトレーニングすることで、FP32モデルと同等またはそれ以上の精度を持つモデルが得られるか?
  • RQ2統一されたトレーニングとデプロイメントパイプラインは、フレームワークとインフェンス環境の間の不一致をどれほど削減し、デプロイメントの複雑さを軽減できるか?
  • RQ3異なる入力事前処理技術は、低精度インフェンスにおける量子化モデルの精度にどのように影響するか?
  • RQ48ビット整数形式でトレーニングする場合、最適化手法の選択と初期値学習率は収束性と最終的な精度にどのような影響を与えるか?
  • RQ5事前学習済みのFP32モデルは、提案されたパイプライン内で効果的に再ターゲティングされ、微調整可能であり、再トレーニングコストを最小限に抑えて高い精度を達成できるか?

主な発見

  • KANJIを用いた8ビット整数形式での直接トレーニングは、CIFAR-10でトップ1正解率81.9%を達成し、異なる事前処理技術を用いたFP32モデル(81.5–81.8%)と同等またはそれ以上の精度を示した。
  • KANJIフレームワークは、FP32モデルと比較してモデルサイズを最大75%まで削減しながら、精度を維持または向上させ、顕著な効率性の向上を示した。
  • KANJIにおけるバッチ正規化に類似した事前処理の導入により、正解率が81.9%まで向上し、標準的な画像ごとの正規化やbinaryprotoベースの事前処理を上回った。
  • KANJIでのトレーニングは1ステップあたりFP32トレーニングに比べ20–25%遅かったが、初期学習率を増加させることで収束性が向上する傾向が示され、トレーニング速度と最適化のトレードオフが明らかになった。
  • 事前学習済みのFP32モデルをFP32で学習し、その後KANJIで微調整するハイブリッドアプローチにより、精度損失の回復に成功し、良好に最適化された事前学習済みモデルの再利用が可能になった。
  • 提案されたパイプラインにより、オペレータの可用性や挙動の違いに起因するデプロイメントの課題が解消され、トレーニンググラフから最適化されたインフェンスグラフへの直接マッピングが可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。