Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Interpretability via Polynomials

Abhimanyu Dubey, Filip Radenović|arXiv (Cornell University)|May 27, 2022
Explainable Artificial Intelligence (XAI)被引用数 9
ひとこと要約

この論文は、多項式の低ランクテンソル分解を用いて、組み合わせ的爆発を回避しながら高次相互作用を効率的に捉えることで、本質的に解釈可能な機械学習モデルであるスケーラブル・ポリノミアル加法的モデル(SPAM)を紹介する。SPAMは、最大10万の特徴量を持つ実世界のベンチマークで、DNN や XGBoost と同等の性能を達成しながらも、人間による評価で顕著に解釈可能であることが検証された。

ABSTRACT

Generalized Additive Models (GAMs) have quickly become the leading choice for inherently-interpretable machine learning. However, unlike uninterpretable methods such as DNNs, they lack expressive power and easy scalability, and are hence not a feasible alternative for real-world tasks. We present a new class of GAMs that use tensor rank decompositions of polynomials to learn powerful, {\em inherently-interpretable} models. Our approach, titled Scalable Polynomial Additive Models (SPAM) is effortlessly scalable and models {\em all} higher-order feature interactions without a combinatorial parameter explosion. SPAM outperforms all current interpretable approaches, and matches DNN/XGBoost performance on a series of real-world benchmarks with up to hundreds of thousands of features. We demonstrate by human subject evaluations that SPAMs are demonstrably more interpretable in practice, and are hence an effortless replacement for DNNs for creating interpretable and high-performance systems suitable for large-scale machine learning. Source code is available at https://github.com/facebookresearch/nbm-spam.

研究の動機と目的

  • DNN のようなブラックボックスモデルの代替として、スケーラブルで本質的に解釈可能なモデルを提供することにより、機械学習における性能と解釈可能性のトレードオフを解消すること。
  • 既存の解釈可能なモデルの限界(スケーラビリティの欠如、表現力の不足、高次相互作用のモデル化が非現実的であること)を、多項式表現を活用することで克服すること。
  • 組み合わせ的爆発を避けるために低ランクテンソル分解を用いることで、大規模な特徴量空間における完全な相互作用モデル化を実現する、エンドツーエンドの効率的訓練を可能にすること。
  • 制御された相互作用次数を持つ多項式ベースのモデルが、非解釈可能なモデルと同等の性能を達成しながらも、優れた解釈可能性を提供することを実証的に検証すること。
  • 人間被験者による評価を通じて、SPAM の説明が LIME や SHAP のような後処理的手法よりも忠実で解釈可能であることを示すこと。

提案手法

  • SPAM は、多項式関数を用いて特徴量の相互作用をモデル化し、その係数を低ランクテンソル分解によってパrameter化することで、効率的な学習とパラメータ数の削減を実現する。
  • 各特徴量が非線形変換され、相互作用が完全な相互作用テンソルの低ランク近似によって捉えられる、一般化された加法的構造を採用する。
  • 確率的勾配降下法(SGD)とバックプロパゲーションを用いたエンドツーエンドの訓練により、GPU 加速と 10万以上の特徴量を含むデータセットへのスケーラビリティを実現する。
  • 多項式係数テンソルにランク制約を導入することで、モデルの複雑さを制御し、組み合わせ的爆発を回避する効率的な最適化を可能にする。
  • 特徴量変換のための線形(SPAM-Linear)およびニューラル(SPAM-Neural)パラメータ化をサポートし、モデル容量の柔軟性を提供する。
  • 粗い正則性仮定の下で、理論的収束性および非漸近的過剰リスクバウンドを確立し、サンプルサイズが増加するにつれてSPAMが最適な多項式に近づくことを示した。

実験結果

リサーチクエスチョン

  • RQ1低ランクテンソル分解を用いた多項式モデルは、大規模な特徴空間にスケーリング可能な解釈可能な機械学習で高い性能を達成できるか?
  • RQ2多項式分解を用いてすべての可能な特徴量相互作用をモデル化することで、相互作用タイプを制限するか、高価な特徴選択を要する既存の解釈可能なモデルよりも優れた性能が得られるか?
  • RQ3SPAM は、数十万の特徴量を持つ実世界の表形式データセットにおいて、DNN や XGBoost と同等の予測精度を達成できるか?
  • RQ4実際の応用において、SPAM の説明は LIME や SHAP のような後処理的手法よりも忠実で解釈可能であるか?
  • RQ5多項式相互作用の次数(例:2次相互作用対比して高次相互作用)が性能に顕著な影響を与えるか、低次のモデルで十分な精度が達成できるか?

主な発見

  • SPAM は、実世界の表形式ベンチマークの多様な設定で、現在の解釈可能なベースラインをすべて上回り、最大10万の特徴量を持つデータセットにおいて DNN や XGBoost と同等の性能を達成した。
  • 大多数の実世界の表形式データセットにおいて、2次相互作用(degree-2 SPAM)が DNN の性能を十分に再現できることから、相互作用モデル化の重要性が、複雑な非線形変換の重要性を上回ることが示された。
  • 人間被験者による評価では、SPAM の説明が LIME や SHAP のような後処理的手法よりも忠実で解釈可能であることが確認され、ブラックボックスモデルの即時置換としての利用価値が裏付けられた。
  • SPAM は、同等の解釈可能なモデルと比較して、パラメータ数を桁違いに削減しながらも高い性能を維持しており、SGD と GPU 加速による効率的な訓練を可能にした。
  • 理論的分析により、SPAM が正則性仮定の下で最適な多項式に収束すること、および古典的な線形およびフルランク多項式のための経典的なバウンドと同等の非漸近的過剰リスクバウンドを提供することが示された。
  • 従来の解釈可能なモデルが計算的に非現実的であるか、相互作用モデル化における組み合わせ的爆発のために失敗する大規模な問題においても、SPAM は効果的にスケーリング可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。