Skip to main content
QUICK REVIEW

[論文レビュー] Unifying and Merging Well-trained Deep Neural Networks for Inference Stage

Yi-Min Chou, Yi-Ming Chan|arXiv (Cornell University)|May 14, 2018
Advanced Neural Network Applications参考文献 17被引用数 6
ひとこと要約

この論文では、リソース制限のあるデバイスにおける効率的な推論を目的として、事前に訓練された深層ニューラルネットワークを統合・統合して1つのコンactなモデルにまとめる手法NeuralMergerを提案する。層の整合化と符号化による代表的重みコードの共有を通じて、元のアーキテクチャを保持し、冗長性を低減するとともに、微調整を可能にすることで性能を維持または向上させ、最大20倍の圧縮が可能であり、精度の低下は最小限に抑えられる。

ABSTRACT

We propose a novel method to merge convolutional neural-nets for the inference stage. Given two well-trained networks that may have different architectures that handle different tasks, our method aligns the layers of the original networks and merges them into a unified model by sharing the representative codes of weights. The shared weights are further re-trained to fine-tune the performance of the merged model. The proposed method effectively produces a compact model that may run original tasks simultaneously on resource-limited devices. As it preserves the general architectures and leverages the co-used weights of well-trained networks, a substantial training overhead can be reduced to shorten the system development time. Experimental results demonstrate a satisfactory performance and validate the effectiveness of the method.

研究の動機と目的

  • リソース制限のあるデバイスへの複数の深層ニューラルネットワークのデプロイという課題に対処し、それらを1つのコンactなモデルに統合すること。
  • 再訓練を一切行わずに、独立して訓練されたネットワーク間の冗長なフィルターや重みを削除すること。
  • 事前に訓練されたモデルの元のアーキテクチャを保持しつつ、複数のタスクの共同推論を可能にすること。
  • コストの高い試行錯誤によるアーキテクチャ設計や共同学習を回避することで、システム開発時間を短縮すること。
  • 重み共有と微調整を活用して、エッジデバイス上で効率的なマルチタスク推論を実現すること。

提案手法

  • 異なる事前に訓練されたネットワークの対応する層(例:畳み込み層や全結合層)をペア構造に整列すること。
  • 代表的コードブックを用いて共有重みを符号化することで、統合されたネットワーク間での重み共有を可能にすること。
  • 異なるネットワークのフィルターや重みを共通の共有表現にマップするための共同符号化方式を適用すること。
  • 知識蒸留の原則を用いて、統合モデルを微調整することで性能を回復または向上させること。
  • 2段階のプロセスを採用する:(1) 重みの整列と符号化、(2) 終端から終端への誤差逆伝播に基づく微調整。
  • 共有コードブック構造を拡張することで、2つ以上のモデルを段階的に統合することを可能にすること。

実験結果

リサーチクエスチョン

  • RQ1異なるアーキテクチャを持つ事前に訓練された複数の深層ニューラルネットワークを、再訓練を一切行わずに1つのコンパクトなモデルに統合できるか?
  • RQ2事前に訓練されたネットワーク間の冗長性は、性能を維持または向上させつつどれほど効果的に削除できるか?
  • RQ3複数のタスクにわたって、精度を保持しつつどれほど高い圧縮が達成できるか?
  • RQ4統合されたモデルは、低性能なデバイス上で同時に複数の推論タスクを処理できるか?
  • RQ5同一の制約下で圧縮された場合、統合モデルの性能は個々のモデルと比べてどの程度か?

主な発見

  • 『LIGHT』設定では、統合モデルが最大20倍の圧縮比を達成し、音声認識タスクでわずか0.25%の精度低下、他のタスクでも許容できる低下を示した。
  • 『ACCU』設定では、統合モデルが12倍以上の圧縮を達成し、平均精度がわずかに低下(0.28%低下)したが、1.8倍の高速化が達成された。
  • 衣類および性別分類の統合モデルでは、性別認識で1.5倍の高速化と0.27%の精度低下、衣類分類で2.8倍の圧縮が達成された。
  • 3つのモデル(衣類、性別、音声)を統合した場合、精度低下はほとんどなかった(衣類で0.38%、性別で1.11%、音声で0.25%)、スケーラビリティが実証された。
  • 本手法は、モデル内およびモデル間の冗長性を効果的に活用し、多様なネットワーク間で効率的な表現を実現した。
  • LeNetよりも大きなモデルを圧縮しても、精度の低下が最小限に抑えられ、高い性能を維持した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。