Skip to main content
QUICK REVIEW

[論文レビュー] Private Model Compression via Knowledge Distillation

Ji Wang, Weidong Bao|arXiv (Cornell University)|Nov 13, 2018
Privacy-Preserving Technologies in Data参考文献 22被引用数 20
ひとこと要約

この論文では、機密性の高いユーザーデータを露呈させることなく、大規模な教師モデルからコンパクトで効率的な学生モデルを訓練するため、微分プライバシーを適用した知識蒸留を用いたプライベートなモデル圧縮フレームワークRonaを提案する。適応的ノルムバウンディングとノイズ注入を用いて、蒸留された知識を動的に制御・摂動することで、SVHNで最大20倍のモデル圧縮と19倍の高速化を達成し、精度損失は0.97%にとどまる。同時に、強力なプライバシー保護(例:(9.83, 10⁻⁶)-微分プライバシー)を保証する。

ABSTRACT

The soaring demand for intelligent mobile applications calls for deploying powerful deep neural networks (DNNs) on mobile devices. However, the outstanding performance of DNNs notoriously relies on increasingly complex models, which in turn is associated with an increase in computational expense far surpassing mobile devices' capacity. What is worse, app service providers need to collect and utilize a large volume of users' data, which contain sensitive information, to build the sophisticated DNN models. Directly deploying these models on public mobile devices presents prohibitive privacy risk. To benefit from the on-device deep learning without the capacity and privacy concerns, we design a private model compression framework RONA. Following the knowledge distillation paradigm, we jointly use hint learning, distillation learning, and self learning to train a compact and fast neural network. The knowledge distilled from the cumbersome model is adaptively bounded and carefully perturbed to enforce differential privacy. We further propose an elegant query sample selection method to reduce the number of queries and control the privacy loss. A series of empirical evaluations as well as the implementation on an Android mobile device show that RONA can not only compress cumbersome models efficiently but also provide a strong privacy guarantee. For example, on SVHN, when a meaningful $(9.83,10^{-6})$-differential privacy is guaranteed, the compact model trained by RONA can obtain 20$ imes$ compression ratio and 19$ imes$ speed-up with merely 0.97% accuracy loss.

研究の動機と目的

  • リソース制約のあるモバイルデバイスに大規模で高精度な深層ニューラルネットワーク(DNN)を導入する課題と、ユーザーのデータプライバシーを守る課題の両方に対処すること。
  • 既存の知識蒸留手法は、機密性の高い訓練データを用いているにもかかわらず、形式的なプライバシー保証を提供しないという限界を克服すること。
  • 教師モデルや機密ユーザーデータを公開せずに、公開データに基づいて訓練されたコンパクトな学生モデルを用いたデバイス内推論を可能にするフレームワークの開発。
  • 蒸留された知識に適切にノイズを注入することで、微分プライバシーを厳密に満たし、プライバシーの証明可能な保証を実現すること。

提案手法

  • 大規模で事前学習済みの教師モデルから、公開訓練データのみを用いて知識蒸留により知識を転送し、小型の学生モデルを学習する。
  • 蒸留過程における勾配の大きさを動的に制御するための適応的ノルムバウンディングを導入し、学習の安定性を向上させるとともに収束を加速する。
  • 蒸留された知識(例:特徴マップやログイット)に適切にスケーリングされたノイズを注入することで、(ε, δ)-微分プライバシーを達成する。
  • 教師モデルへのクエリ回数を削減するためのクエリ効率の良いサンプル選択メカニズムを設計し、プライバシー予算の消費を最小限に抑える。
  • 追加のクエリやプライバシーコストを要せず、自己学習を統合することで学生モデルの性能を向上させる。
  • ヒント学習(中間層の監視)、蒸留学習(出力のソフトラベル一致)、および自己学習(偽ラベル付け)を組み合わせることで、学生モデルの一般化性能を向上させる。

実験結果

リサーチクエスチョン

  • RQ1教師モデルが機密性の高いユーザーデータで学習されている場合、データやモデルを公開せずに知識蒸留をプライベートに安全に実行することは可能か?
  • RQ2微分プライバシーを、蒸留された知識(例:特徴マップやログイット)に効果的に適用することで、証明可能なプライバシー保証を達成できるか?
  • RQ3高い精度と低いプライバシー予算消費を維持しつつ、どの程度のモデル圧縮が達成可能か?
  • RQ4適応的クエリ選択と自己学習技術により、性能を劣化させることなく教師モデルへのクエリ回数を削減できるか?
  • RQ5特定のデータクラス(例:数字6と9)が極めて機密とされ、学習から除外される現実的な条件下で、このフレームワークはどの程度の性能を示すか?

主な発見

  • SVHNでは、Ronaは20倍の圧縮比と19倍の高速化を達成し、精度損失は0.97%にとどまり、(9.83, 10⁻⁶)-微分プライバシーを保証する。
  • MNISTでは、Ronaは(7.68, 10⁻⁵)-微分プライバシーのもとで98.64%の精度を達成し、同等のプライバシー制約下で先行研究を上回る性能を示す。
  • CIFAR-10では、Ronaは(8.87, 10⁻⁵)-微分プライバシーのもとで81.69%の精度を達成し、類似のプライバシー予算下で73%の精度しか報告しなかった先行手法を上回る。
  • 適応的ノルムバウンディング手法は学習を著しく加速させ、より少ないクエリエポック数と低いプライバシー損失で高い性能を達成する。
  • 学生モデルが特定の機密クラス(例:MNISTの数字6と9)を一度も学習していない状況でも、Ronaは(ε=29.8, δ=10⁻⁶)のプライバシー下で認識精度を0%から53.43%まで向上させる。
  • フレームワークは効率的なデバイス内デプロイを可能にする:Huawei Honor 8では、MNISTで学生モデルが教師モデルよりも11倍速く実行され、精度低下はたった0.2%にとどまる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。