Skip to main content
QUICK REVIEW

[論文レビュー] Scalable Bayesian Rule Lists

Hongyu Yang, Cynthia Rudin|arXiv (Cornell University)|Feb 27, 2016
Bayesian Modeling and Causal Inference参考文献 30被引用数 9
ひとこと要約

この論文では、効率的な計算、スクリーニング境界、計算の再利用を用いて、ルールリスト上のベイジアンハイアラルキー・モデルを最適化する、高速で解釈可能な確率的分類器であるスケーラブル・ベイジアン・ルール・リスト(SBRL)を紹介する。SBRLは、従来の手法と比較して2桁の速度向上を達成しながら、ベンチマークデータセットにおける意思決定木の精度とスパarsityを同等または上回っている。

ABSTRACT

We present an algorithm for building probabilistic rule lists that is two orders of magnitude faster than previous work. Rule list algorithms are competitors for decision tree algorithms. They are associative classifiers, in that they are built from pre-mined association rules. They have a logical structure that is a sequence of IF-THEN rules, identical to a decision list or one-sided decision tree. Instead of using greedy splitting and pruning like decision tree algorithms, we fully optimize over rule lists, striking a practical balance between accuracy, interpretability, and computational speed. The algorithm presented here uses a mixture of theoretical bounds (tight enough to have practical implications as a screening or bounding procedure), computational reuse, and highly tuned language libraries to achieve computational efficiency. Currently, for many practical problems, this method achieves better accuracy and sparsity than decision trees; further, in many cases, the computational time is practical and often less than that of decision trees. The result is a probabilistic classifier (which estimates P(y = 1|x) for each x) that optimizes the posterior of a Bayesian hierarchical model over rule lists.

研究の動機と目的

  • 精度、解釈可能性、計算効率のバランスを取った確率的分類器を開発すること。これは、グリーディー意思決定木アルゴリズムの限界を克服することを目的としている。
  • 意思決定木の局所的最適化の欠陥を克服するため、ベイジアン後験分布最大化を用いて、ルールリスト全体をグローバルに最適化すること。
  • 理論的境界、頻出パターンマイニング、高性能計算の組み合わせにより、ルールリストに対する実用的でスケーラブルな推論を可能にすること。
  • 高精度で人間が解釈可能なスパースな論理的ルールリストを生成すること。実世界の導入に適している。

提案手法

  • SBRLは、データに基づくルールリストの後験確率を最大化するという原則的で明確な目的を定義するため、ベイジアンハイアラルキー・モデルを用いる。
  • 探索空間を、最小限のインスタンスをカバーするルールに制限するために、データから頻出パターンを事前にマイニングする。これにより、組み合わせ爆発を抑える。
  • 後験確率に対するきつい解析的境界を用いて、非最適なルールをスクリーニングし、探索空間を効率的に pruning する。
  • 計算の再利用を適用する:ルールリストを変更する際、変更点以下のデータの評価のみを再計算し、それより上の部分の結果は再利用する。
  • 繰り返しのルールリスト評価を高速化するため、高度に最適化された低レベルライブラリを活用し、高速なイテレーションを実現する。
  • これらの要素を統合することで、意思決定木で用いられるグリーディーなヒューリスティクスを避ける、ルールリスト全体のグローバル最適化を実現する。

実験結果

リサーチクエスチョン

  • RQ1グローバルに最適化されたルールリスト分類器は、計算可能性を保ちつつ、精度とスパarsityの面でグリーディー意思決定木アルゴリズムを上回ることができるか?
  • RQ2後験確率の理論的境界は、ルールリスト最適化における実用的スクリーニングツールとして十分にきついものとなるか?
  • RQ3計算の再利用と高性能ライブラリの組み合わせにより、ルールリスト最適化の時間計算量を2桁分削減できるか?
  • RQ4得られた確率的ルールリストは、高い解釈可能性を維持しながら、標準ベンチマークで最先端の性能を達成できるか?

主な発見

  • SBRLは、ベイジアン・ルール・リスト学習のための従来の最良実装と比較して、2桁以上の高速化を達成した。
  • UCIのマッシュルームデータセットでは、ラップトップ上で約9秒で完全な汎化精度のルールリストを学習した。
  • UCIのアダルデータセットでは、高度にチューニングされたCARTやC4.5意思決定木よりも高い汎化AUCを達成した。
  • この手法は、確率的出力を伴うスパースで解釈可能なルールリストを生成し、各入力xに対してP(y=1|x)を推定する。
  • 解析的後験確率境界の使用により、解法の品質を損なうことなく、非最適なルール組み合わせの有効な pruning が可能になった。
  • 計算の再利用と最適化されたライブラリのおかげで、ルールリストの変更評価が効率的に行えるようになり、グローバル最適化が現実可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。