[論文レビュー] Data Debugging with Shapley Importance over End-to-End Machine Learning Pipelines
この論文では、エンドツーエンドの機械学習パイプラインにおけるトレーニング例のシャープレイ値を効率的に計算する最初のシステムであるDataScopeを紹介する。パイプラインを「正準パイプライン」(関係代数クエリに続くKNN分類器)としてモデル化することで、多くの部分クラスにおいてPTIMEの複雑度を達成し、モンテカルロ法と比較して最大4桁の速度向上を実現しながら、データデバッグの有効性を維持または向上させた。
Developing modern machine learning (ML) applications is data-centric, of which one fundamental challenge is to understand the influence of data quality to ML training -- "Which training examples are 'guilty' in making the trained ML model predictions inaccurate or unfair?" Modeling data influence for ML training has attracted intensive interest over the last decade, and one popular framework is to compute the Shapley value of each training example with respect to utilities such as validation accuracy and fairness of the trained ML model. Unfortunately, despite recent intensive interest and research, existing methods only consider a single ML model "in isolation" and do not consider an end-to-end ML pipeline that consists of data transformations, feature extractors, and ML training. We present DataScope (ease.ml/datascope), the first system that efficiently computes Shapley values of training examples over an end-to-end ML pipeline, and illustrate its applications in data debugging for ML training. To this end, we first develop a novel algorithmic framework that computes Shapley value over a specific family of ML pipelines that we call canonical pipelines: a positive relational algebra query followed by a K-nearest-neighbor (KNN) classifier. We show that, for many subfamilies of canonical pipelines, computing Shapley value is in PTIME, contrasting the exponential complexity of computing Shapley value in general. We then put this to practice -- given an sklearn pipeline, we approximate it with a canonical pipeline to use as a proxy. We conduct extensive experiments illustrating different use cases and utilities. Our results show that DataScope is up to four orders of magnitude faster over state-of-the-art Monte Carlo-based methods, while being comparably, and often even more, effective in data debugging.
研究の動機と目的
- 現代のMLパイプラインにデータ変換や特徴抽出器を含むが、スケーラブルでエンドツーエンドのデータ重要度計算が不足している問題に対処すること。
- 個別のモデルではなく、完全なMLパイプライン上でシャープレイ値を計算することで、効率的かつ正確なデータデバッグを可能にすること。
- 関係データプロバンセンス理論と現代のMLパイプラインを、実行可能なアルゴリズムフレームワークを通じて橋渡しすること。
- 正準パイプライン上でのシャープレイ値計算が、一般ケースにおける指数的複雑度とは対照的に、多くの部分クラスにおいてPTIMEに属することを示すこと。
- 実用的なシステムであるDataScopeを提供し、正準パイプラインに置き換えることで、実際のsklearnパイプラインを効率的なデータ重要度分析に適応させること。
提案手法
- 著者らは、正の関係代数クエリに続くKNN分類器からなるパイプラインのクラス「正準パイプライン」を定義する。
- 多くの正準パイプラインの部分クラスにおいて、シャープレイ値計算がPTIMEに属することを証明し、一般ケースにおける指数的複雑度を回避する。
- 特徴工学とモデルプロキシングを用いて、実際のsklearnパイプラインを正準パイプラインに変換することで、それらを近似する。
- DataScopeは、データプロバンセンスと知識コンパイル技術を活用して、パイプライン全体を通じたトレーニング例の影響を追跡する。
- KNNプロキシモデルを用いてシャープレイ値を効率的に推定し、大規模データセット上でのスケーラブルな計算を可能にする。
- 軽量なインストルメンテーションにより、既存のMLワークフローに統合され、エンドツーエンドのパイプラインデバッグを支援する。
実験結果
リサーチクエスチョン
- RQ1一般ケースにおける指数的複雑度にかかわらず、エンドツーエンドのMLパイプライン上でのシャープレイ値計算を実行可能にすることができるか?
- RQ2どのようなMLパイプラインクラスが、データデバッグのための実用的価値を保ちつつ、多項式時間でのシャープレイ値計算を可能にするか?
- RQ3実世界のsklearnパイプラインを効果的に正準パイプラインに近似することで、効率的なデータ重要度分析を可能にする方法は何か?
- RQ4正準パイプライン上で計算されたシャープレイベースのデータ重要度は、最先端のモンテカルロ法と比較して、どの程度データデバッグの効果を向上させるか?
- RQ5データプロバンセンスと関係代数をMLパイプライン分析と効果的に統合することで、スケーラブルで説明可能なデータデバッグを可能にすることができるか?
主な発見
- DataScopeは、最先端のモンテカルロベースのシャープレイ値計算手法と比較して、最大4桁の速度向上を達成した。
- 正準パイプラインの多くの部分クラスにおいて、シャープレイ値計算がPTIMEに属することを示し、一般ケースが非効率である場合でも、正確な計算が効率的に可能となった。
- モンテカルロベースラインと同等またはそれ以上の有効性を示し、とくに問題のあるトレーニング例を特定する際に優れた性能を発揮した。
- 実際のsklearnパイプラインを正準パイプラインに近似することで、データ重要度順位の忠実性が保持され、実用的な展開が可能となった。
- データプロバンセンスと知識コンパイルの統合により、特徴抽出とモデル学習の各段階にわたる、スケーラブルでエンドツーエンドの影響分析が可能になった。
- 実験的評価により、DataScopeで計算されたシャープレイ値が、ノイズの多いまたはバイアスのかかっている例を含むデータ品質の問題を効果的に特定することが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。