Skip to main content
QUICK REVIEW

[論文レビュー] Interpreting Shared Deep Learning Models via Explicable Boundary Trees

Huijun Wu, Chen Wang|arXiv (Cornell University)|Sep 12, 2017
Explainable Artificial Intelligence (XAI)参考文献 19被引用数 5
ひとこと要約

本稿では、プライバシーまたは競争上の制約により訓練データを公開できない状況において、信頼性を高めるために、モデルの意思決定境界を高精度に近似する代表的な訓練データの最小集合を公開する方法として、説明可能な境界木(EB-tree)を提案する。最大マージン境界接続アルゴリズムを用いることで、ユーザーは走査パスを通じて予測を解釈可能にし、訓練データの0.3%未満の公開で99.5%を超える忠実度を達成するとともに、誤標籤データの特定や新規クラスの検出が可能となる。

ABSTRACT

Despite outperforming the human in many tasks, deep neural network models are also criticized for the lack of transparency and interpretability in decision making. The opaqueness results in uncertainty and low confidence when deploying such a model in model sharing scenarios, when the model is developed by a third party. For a supervised machine learning model, sharing training process including training data provides an effective way to gain trust and to better understand model predictions. However, it is not always possible to share all training data due to privacy and policy constraints. In this paper, we propose a method to disclose a small set of training data that is just sufficient for users to get the insight of a complicated model. The method constructs a boundary tree using selected training data and the tree is able to approximate the complicated model with high fidelity. We show that traversing data points in the tree gives users significantly better understanding of the model and paves the way for trustworthy model sharing.

研究の動機と目的

  • プライバシーや競争上の制約により訓練データを公開できない状況において、共有された深層ニューラルネットワークモデルにおける解釈可能性と信頼性の欠如を是正すること。
  • モデルユーザーが予測の*理由*を理解できるように、小さな代表的訓練データサブセットを通じて意思決定境界を明らかにすること。
  • モデルの内部構造や全訓練データにアクセスせずに、複雑なDNNの意思決定境界を高精度に近似するコンactかつ解釈可能な構造を開発すること。
  • 計算コストを低減することで、実用的なモデル共有シナリオを支援し、誤標籤データやデータストリームにおける新規クラスの検出を可能にすること。

提案手法

  • 最大マージンに基づく境界接続アルゴリズムにより、DNNモデルの意思決定境界を形成する上で顕著に寄与する代表的な訓練データポイントを選択する。
  • 選択された訓練データは、DNN埋め込み特徴空間における距離に基づいて構築される、説明可能な境界木(EB-tree)に整理される。各ノードは訓練データポイントを表し、木構造が形成される。
  • 木の走査により、テストサンプルが代表的な訓練データポイントを通ってどのように分類に至ったかを追跡でき、特徴空間における差異が分類意思決定にどのように寄与したかを明らかにできる。
  • EB-tree内の訓練データポイントの信頼度値を用いることで、DNNの意思決定境界を模倣し、テストサンプルの摂動に依存せず、概念の変化(concept drift)への感受性を低減する。
  • 新規クラス検出のため、EB-tree内で同じ走査パスを共有する訓練データポイントと比較した際の距離差に基づきp値を計算し、統計的新規性を評価するためのコンフォーマル評価を用いる。
  • EB-tree構造により、ストリーミング推論中に必要な距離計算の数を、関連する訓練データサブセットに限定することで、計算コストを削減する。

実験結果

リサーチクエスチョン

  • RQ1複雑な深層ニューラルネットワークの意思決定境界を効果的に説明するために、小さな代表的訓練データサブセットを用いることは可能か?
  • RQ2選択された訓練データから構築された木構造は、標準的な解釈可能手法と比較して、ユーザーのモデル予測理解をどの程度向上させられるか?
  • RQ3EB-treeは、最小限の訓練データ公開で、DNNの意思決定境界をどの程度高い忠実度で近似できるか?
  • RQ4EB-tree構造は、データストリームにおける誤標籠訓練サンプルや新規クラスの検出に利用可能か?

主な発見

  • EB-treeは、訓練データの0.3%未満を用いて、元のDNNモデルの予測を99.5%を超える忠実度で近似した。
  • 人間によるパイロットスタディの結果、テストサンプルをEB-treeを走査することで、DNNの予測がどのように行われたかをユーザーが著しく理解しやすくなった。
  • EB-treeの意思決定境界付近で検出されたことから、MNISTの誤標籠サンプル(例:'9'が'3'や'5'とラベル付けされているもの)を効果的に同定できた。
  • 新規クラス検出において、ストリーム内での未学習クラスの'9'サンプルを99.1%の正確度で同定し、ベースライン手法と比較して計算コストを97.1%削減した。
  • EB-treeは、木内で同じ走査パスを共有する訓練データポイントに限って距離計算を制限することで、効率的な新規クラス検出を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。