Skip to main content
QUICK REVIEW

[論文レビュー] A Scalable MIP-based Method for Learning Optimal Multivariate Decision Trees

Haoran Zhu, Pavankumar Murali|arXiv (Cornell University)|Nov 6, 2020
Machine Learning and Data Classification被引用数 17
ひとこと要約

本稿は、1-ノルムSVMに基づく新しいMIP定式化、SVM1-ODTを提案する。この定式化により、従来のMIPおよびヒューリスティック手法と比較して、汎化精度を6–20%向上させた最適な多変量意思決定木の学習が可能になる。線形緩和のタイトネスを高めるために切断平面を導入し、スケーラブルなLPベースのデータ選択法を採用することで、最大245,000件のサンプルを含むデータセットの学習が可能となり、従来のMIPベース手法の5,500件の制限を上回る。

ABSTRACT

Several recent publications report advances in training optimal decision trees (ODT) using mixed-integer programs (MIP), due to algorithmic advances in integer programming and a growing interest in addressing the inherent suboptimality of heuristic approaches such as CART. In this paper, we propose a novel MIP formulation, based on a 1-norm support vector machine model, to train a multivariate ODT for classification problems. We provide cutting plane techniques that tighten the linear relaxation of the MIP formulation, in order to improve run times to reach optimality. Using 36 data-sets from the University of California Irvine Machine Learning Repository, we demonstrate that our formulation outperforms its counterparts in the literature by an average of about 10% in terms of mean out-of-sample testing accuracy across the data-sets. We provide a scalable framework to train multivariate ODT on large data-sets by introducing a novel linear programming (LP) based data selection method to choose a subset of the data for training. Our method is able to routinely handle large data-sets with more than 7,000 sample points and outperform heuristics methods and other MIP based techniques. We present results on data-sets containing up to 245,000 samples. Existing MIP-based methods do not scale well on training data-sets beyond 5,500 samples.

研究の動機と目的

  • CART や C4.5 といったヒューリスティック意思決定木手法が、将来の分割を考慮せずにグリーディに1回ずつ分割を決定するという、部分最適性の問題を解決すること。
  • 既存のMIPベースの最適意思決定木(ODT)手法が、変数および制約の増加に伴い5,500件程度のサンプルを超えるデータセットではスケーラビリティに欠けるという課題を克服すること。
  • 1-ノルムSVMにインspiredされたMIP定式化を用いて、マージンを最大化し、分類精度を高める、堅牢でスケーラブルな多変量ODTの学習フレームワークを構築すること。
  • MIPベースのODT学習の実行可能性を、大規模な実世界データに対して高めるために、全データセットから重要な情報を保持する新しいLPベースのデータ選択法を導入すること。

提案手法

  • 多変量分割を可能にするために、分類マージンと正しく分類されたインスタンス数を最大化する目的関数を用いた、新しいMIP定式化SVM1-ODTを提案する。
  • MIP定式化の線形緩和をタイトにすることで、整数性ギャップを低減し、最適解への収束を加速するため、切断平面技術を組み込む。
  • 再定式化により、big-M制約の使用を排除することで、数値的安定性と解の品質を向上させる。
  • MIP学習の前段階で、代表的なデータポイントのサブセットを選択するLPベースのデータ選択法を導入し、問題サイズを縮小しながら情報の保持を実現する。
  • 選択されたサブセットを用いて、SVM1-ODT MIPモデルを用いてODTを学習し、各データセットに応じてパラメータを最適化することで、精度と実行時間のバランスを取る。
  • 2段階のトレーニングパイプライン(データ選択 → 最適木学習)を採用することで、245,000件を超えるサンプルを含むデータセットへのスケーラビリティを実現する。

実験結果

リサーチクエスチョン

  • RQ11-ノルムSVMに基づくMIP定式化は、多変量意思決定木の汎化分類精度において、既存のMIPおよびヒューリスティック手法を上回ることができるか?
  • RQ2MIP緩和をどのようにタイトにすれば、大規模ODT学習における解法時間と最適性ギャップを改善できるか?
  • RQ3LPベースのデータ選択法は、大規模データセットの学習に際し、問題サイズを縮小しながらもモデル性能を維持できるか?
  • RQ4従来のMIPベースODT手法の5,500件のサンプル制限を超えるデータセットに対しても、本手法はスケーラブルに拡張可能か?
  • RQ5SVM1-ODTとデータ選択の組み合わせにより、多様な実世界データセットにおいて一貫した精度および効率の向上が得られるか?

主な発見

  • SVM1-ODT定式化は、木の深さが2の20個のUCIデータセットにおいて、最先端のMIPおよびヒューリスティック手法と比較して、平均6–10%の汎化テスト精度の向上を達成した。
  • 木の深さが3の場合、テスト精度で平均17–20%の向上を示し、深い木においても優れた性能を発揮した。
  • LPベースのデータ選択法により、トレーニングサンプル数を元のデータセットの1–12%にまで削減しながらも高い精度を維持でき、最大245,000件のデータセットでの学習が可能になった。
  • Avila(104,300件)およびskin-segmentation(245,057件)といった大規模データセットにおいて、深さ3の条件下でそれぞれ86.3%および94.9%のテスト精度を達成し、CARTおよびOCT-Hを上回った。
  • 本手法は、精度およびスケーラビリティの両面でベースラインMIPモデルおよびヒューリスティックベースラインを一貫して上回り、大規模データセットでも4時間以内のトレーニング時間で実行可能であった。
  • 切断平面の導入およびbig-M制約の排除により、MIP緩和のタイトネスが顕著に向上し、解法時間の短縮と最適性ギャップの改善が達成された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。