Skip to main content
QUICK REVIEW

[論文レビュー] Confidence Decision Trees via Online and Active Learning for Streaming (BIG) Data

Rocco De Rosa|arXiv (Cornell University)|Apr 12, 2016
Data Stream Mining Techniques参考文献 26被引用数 3
ひとこと要約

本稿では、ストリーミングデータにおける分割選択に洗練された信頼区間を用いるConfidence Decision Trees (CDT) を提案し、エントロピー、ジニ係数、Kearns-Mansour基準を用いた利益のより良い推定により、Hoeffdingツリーに比べて精度を向上させている。また、ラベルコストを削減しながら高い性能を維持するためのアクティブラーニングモジュールを導入しており、部分的でない分割選択確率に関する理論的保証と、実験的検証により優れた精度と頑健性を示している。

ABSTRACT

Decision tree classifiers are a widely used tool in data stream mining. The use of confidence intervals to estimate the gain associated with each split leads to very effective methods, like the popular Hoeffding tree algorithm. From a statistical viewpoint, the analysis of decision tree classifiers in a streaming setting requires knowing when enough new information has been collected to justify splitting a leaf. Although some of the issues in the statistical analysis of Hoeffding trees have been already clarified, a general and rigorous study of confidence intervals for splitting criteria is missing. We fill this gap by deriving accurate confidence intervals to estimate the splitting gain in decision tree learning with respect to three criteria: entropy, Gini index, and a third index proposed by Kearns and Mansour. Our confidence intervals depend in a more detailed way on the tree parameters. We also extend our confidence analysis to a selective sampling setting, in which the decision tree learner adaptively decides which labels to query in the stream. We furnish theoretical guarantee bounding the probability that the classification is non-optimal learning the decision tree via our selective sampling strategy. Experiments on real and synthetic data in a streaming setting show that our trees are indeed more accurate than trees with the same number of leaves generated by other techniques and our active learning module permits to save labeling cost. In addition, comparing our labeling strategy with recent methods, we show that our approach is more robust and consistent respect all the other techniques applied to incremental decision trees.

研究の動機と目的

  • ストリーミング環境下における意思決定ツリーの分割基準における信頼区間の厳密な統計的分析の欠如に対処すること。
  • エントロピー、ジニ係数、Kearns-Mansour係数という3つの主要な分割基準のための、よりきめ細やかで正確な信頼区間を構築すること。
  • ラベルの取得コストを低減するために、学習者がどのラベルを問い合わせるべきかを決定する選択的サンプリング(アクティブラーニング)設定にフレームワークを拡張すること。
  • 提案された信頼区間を用いた場合の、部分的でない分割選択確率に関する理論的保証を提供すること。
  • 提案手法が、既存のインクリメンタル意思決定ツリー手法に比べて、より高い精度と優れたラベル効率を達成していることを実験的に検証すること。

提案手法

  • Hoeffding型不等式を応用し、エントロピー、ジニ、Kearns-Mansour基準の分割利益推定のための新たな信頼区間の境界を導出する。
  • Kullback-Leibler発散と平方根変換の技術を用いて、分割基準の推定誤差に対するよりきつい境界を導出する。
  • 信頼区間を用いて、どのラベルを問い合わせるべきかを判断する選択的サンプリング戦略を導入し、ラベルコストを最小限に抑えつつ精度を維持する。
  • すべてのツリーのノードにおける部分的でない分割選択確率を制御するために、ユニオンバウンドと濃度不等式の再帰的適用を用いる。
  • 全体の誤差制御を維持するために、処理済みの例の数に応じて時間に依存する信頼水準を採用する。
  • 理論的分析により、例がτ-部分的でない分割を通す確率がδ以下に抑えられ、δは時間とともに減少することが示された。

実験結果

リサーチクエスチョン

  • RQ1ストリーミング意思決定ツリーにおけるエントロピー、ジニ、Kearns-Mansour分割基準に対して、よりきつい信頼区間を導出できるか?
  • RQ2これらの洗練された信頼区間は、標準的なHoeffding境界と比較して、分割選択の正確性をどのように向上させるか?
  • RQ3これらの信頼区間に基づくアクティブラーニング戦略は、分類精度を損なわずにラベルコストを削減できるか?
  • RQ4提案手法を用いた場合、部分的でない分割の選択確率に関する理論的保証はどのようなものか?
  • RQ5提案手法は、実データおよび合成ストリーミングデータにおいて、既存のインクリメンタル意思決定ツリーアルゴリズムと比較して、精度およびラベル効率の点で優れているか?

主な発見

  • 提案された信頼区間は、同じ数のリーフを有する標準的なHoeffdingツリーと比較して、より正確な意思決定ツリーを生成する。
  • アクティブラーニングモジュールは、インクリメンタルツリー用の他のアクティブラーニング戦略と比較して、ラベルコストを顕著に削減しながら、分類精度を維持または向上させる。
  • 理論的分析により、例がτ-部分的でない分割を通す確率がδ以下に抑えられ、δは時間とともに減少することが示された。
  • 実験的結果により、本手法は、インクリメンタル意思決定ツリーに適用された最近のアクティブラーニング技術と比較して、より頑健で一貫性のある性能を示している。
  • 信頼区間におけるKL発散と平方根変換の使用により、標準的なHoeffdingスタイルの境界と比較して、推定誤差の境界がよりきつくなった。
  • 合成および実世界のストリーミングデータの両方において、本手法は精度およびラベル効率の点で、既存の手法を上回っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。