Skip to main content
QUICK REVIEW

[論文レビュー] Improving the Interpretability of Deep Neural Networks with Knowledge Distillation

Xuan Liu, Xiaoguang Wang|arXiv (Cornell University)|Dec 28, 2018
Explainable Artificial Intelligence (XAI)参考文献 43被引用数 11
ひとこと要約

この論文は、知識蒸留を用いて深層ニューラルネットワーク(DNN)を決定木に蒸留することで、精度を損なわずに解釈可能性を向上させる手法を提案している。DNNの教師モデルから得られるソフトラベル(ログチット)を決定木の学生モデルに転送することにより、同じ深さにおいてアンサンブル木とは対照的に1–5%高い精度を達成し、モデルの解釈可能性を維持したまま性能が向上することを示している。

ABSTRACT

Deep Neural Networks have achieved huge success at a wide spectrum of applications from language modeling, computer vision to speech recognition. However, nowadays, good performance alone is not sufficient to satisfy the needs of practical deployment where interpretability is demanded for cases involving ethics and mission critical applications. The complex models of Deep Neural Networks make it hard to understand and reason the predictions, which hinders its further progress. To tackle this problem, we apply the Knowledge Distillation technique to distill Deep Neural Networks into decision trees in order to attain good performance and interpretability simultaneously. We formulate the problem at hand as a multi-output regression problem and the experiments demonstrate that the student model achieves significantly better accuracy performance (about 1\% to 5\%) than vanilla decision trees at the same level of tree depth. The experiments are implemented on the TensorFlow platform to make it scalable to big datasets. To the best of our knowledge, we are the first to distill Deep Neural Networks into vanilla decision trees on multi-class datasets.

研究の動機と目的

  • 医療などミッションクリティカルな分野において、深層学習におけるモデルの解釈可能性と高い性能の両立というジレンマを解決すること。
  • 複雑なデータセットではしばしば性能が劣る、本質的に解釈可能なモデル(例:決定木)の精度を向上させること。
  • DNNの「暗黙の知識」(ソフト予測)を活用し、より単純で解釈可能な学生モデルの学習を支援すること。
  • 知識蒸留がモデル圧縮の目的だけでなく、機械学習における解釈可能性の向上にも応用可能であることを示すこと。

提案手法

  • 本手法は、知識蒸留を多出力回帰問題として定式化し、学生モデルが事前に学習済みのDNN教師モデルのログチットを予測するように学習させる。
  • DNNから得られるソフトラベル(ソフトマックス前のログチット)を用いて決定木を学習させ、ハードラベルに比べてより豊かな情報を保持する。
  • 温度スケーリングを用いて確率分布を平滑化し、知識の転送を強化する。
  • 学生モデルは教師と同じ訓練およびテストデータを用いて学習させ、公平な比較を保証する。
  • スケーラビリティと再現可能性を確保するため、TensorFlowを用いてMNISTおよびConnect-4データセットで実験を実施する。
  • 人間が理解可能な範囲を維持するため、木の深さを10に制限する。

実験結果

リサーチクエスチョン

  • RQ1知識蒸留を用いることで、決定木の精度を向上させつつその解釈可能性を維持できるか?
  • RQ2同じデータで学習されたアンサンブル木と比較して、DNNのログチットを用いた蒸留はどの程度優れているか?
  • RQ3学生モデルの性能は、教師モデルの品質にどの程度依存するか?
  • RQ4木の深さが制限されている場合と制限されていない場合とで、蒸留による精度向上の差はどの程度か?

主な発見

  • MNISTおよびConnect-4データセットの両方において、同じ木の深さで蒸留された決定木の学生モデルは、アンサンブル木よりも1–5%高い精度を達成した。
  • MNISTでは、深さ10の学生モデルが86.55%の精度に達し、エントロピー基準を用いた最良のアンサンブル木(84.50%)を上回った。
  • Connect-4では、深さ10の学生モデルが73.42%の精度に達し、ジニ基準を用いたアンサンブル木(70.44%)を上回った。
  • 木の深さが制限されていない場合でも、学生モデルはアンサンブル木を上回った(MNISTでは88.28% vs. 87.40%)、ただし向上幅は小さい。
  • 木の深さが制限されている場合に蒸留効果が顕著に現れ、本手法がコンパクトで人間が読めるモデル内で高い精度を実現できることを確認した。
  • 結果から、知識蒸留が解釈可能なモデルと複雑なDNNの間の性能格差を顕著に縮小できることを示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。