Skip to main content
QUICK REVIEW

[論文レビュー] Rule Covering for Interpretation and Boosting

Ş. İlker Birbil, Mert Edali|arXiv (Cornell University)|Jul 13, 2020
Neural Networks and Applications参考文献 19被引用数 4
ひとこと要約

本稿では、ランダムフォレストとブースティング意思決定木の解釈に、数学的プログラミングに基づく2つのアルゴリズムを提案する。最初のアルゴリズムは、トレーニング済みのランダムフォレストから、最小限の数の高精度ルールを抽出し、元のモデルに近い性能を達成しつつ、はるかに少ないルール数で実現する。2番目のアルゴリズムは、双対に基づくサンプル重み付けを用いた列生成法を用い、段階的にベースとなる意思決定木を改善する。この手法は、複数のデータセットにおいて標準的なブースティング手法を上回る性能を発揮する。

ABSTRACT

We propose two algorithms for interpretation and boosting of tree-based ensemble methods. Both algorithms make use of mathematical programming models that are constructed with a set of rules extracted from an ensemble of decision trees. The objective is to obtain the minimum total impurity with the least number of rules that cover all the samples. The first algorithm uses the collection of decision trees obtained from a trained random forest model. Our numerical results show that the proposed rule covering approach selects only a few rules that could be used for interpreting the random forest model. Moreover, the resulting set of rules closely matches the accuracy level of the random forest model. Inspired by the column generation algorithm in linear programming, our second algorithm uses a rule generation scheme for boosting decision trees. We use the dual optimal solutions of the linear programming models as sample weights to obtain only those rules that would improve the accuracy. With a computational study, we observe that our second algorithm performs competitively with the other well-known boosting methods. Our implementations also demonstrate that both algorithms can be trivially coupled with the existing random forest and decision tree packages.

研究の動機と目的

  • トレーニング済みのランダムフォレストモデルの解釈を目的とし、予測精度を保持する最小限のルール集合を抽出する手法の開発。
  • 最も効果的なルールのみを段階的に生成することでモデル性能を向上させるブースティングアルゴリズムの構築。
  • ルール抽出とルールベースのブースティングを、既存の機械学習フレームワークに最小限の実装コストで統合する。
  • 数学的プログラミングが、モデルの解釈可能性と予測性能の両方を同時に向上させられることを示すこと。

提案手法

  • 最初のアルゴリズムは、混合整数線形計画問題として定式化され、すべてのトレーニングサンプルをカバーする最小数のルールを選択し、合計不純度を最小化する。
  • ルールは、トレーニング済みのランダムフォレスト内の意思決定木の葉から抽出され、数学的プログラミングモデルの入力として使用される。
  • 2番目のアルゴリズムは列生成法を用いる:各反復で、価格設定サブプロブレムが双対目的関数を低下させる新しいルールを同定し、双対解をサンプル重みとして使用する。
  • 線形計画問題の双対最適解を用いて、誤分類されたサンプルを再重み付けし、その後の反復で高影響力を持つルールの生成を誘導する。
  • 段階的に緩和された線形計画問題を解き、最も有益なルールのみを追加することで、モデルの精度を段階的に向上させる。
  • 両アルゴリズムは、既存のランダムフォレストおよび意思決定木パッケージと互換性を持つように設計されており、プラグイン統合が可能である。

実験結果

リサーチクエスチョン

  • RQ1ランダムフォレストモデルから抽出された最小限のルール集合が、完全なアンサンブルと同等の予測精度を達成できるか?
  • RQ2数学的プログラミングを用いたルールベースのブースティングフレームワークが、AdaBoost や勾配ブースティングといった標準的なブースティングアルゴリズムを上回れるか?
  • RQ3線形計画問題の双対解をサンプル重みとして用いることで、ブースティングにおけるルール生成を効果的に誘導できるか?
  • RQ4ルールカバリングによって、モデルの複雑さをどれほど低減しつつ、精度を維持できるか、解釈可能性がどの程度向上するか?

主な発見

  • MIRCOアルゴリズムは、15のデータセットのうち14でランダムフォレストと同等のテスト精度を達成し、平均してテストサンプルの6%未満が見逃された。
  • MIRCOは、1つのデータセットを除き、ランダムフォレストおよび意思決定木よりも少ないルール数を生成し、解釈可能性が著しく向上した。
  • RCBoostは4つのデータセットでAdaBoostおよび勾配ブースティングを上回り、最小限のルール生成で競争力のある性能を示した。
  • RCBoostにおけるRMP(価格設定サブプロブレム)の呼び出し回数は平均50未満であり、収束が効率的であることが示された。
  • MIRCOにおけるルール数の標準偏差は、ほとんどのデータセットで意思決定木よりも低く、より安定したルールセット生成が行われたことを示した。
  • 両アルゴリズムはPythonで実装され、既存の機械学習ライブラリと互換性があり、容易な統合が可能であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。