Skip to main content
QUICK REVIEW

[論文レビュー] Decision trees are PAC-learnable from most product distributions: a smoothed analysis

Adam Tauman Kalai, Shang‐Hua Teng|ArXiv.org|Dec 4, 2008
Machine Learning and Algorithms参考文献 12被引用数 6
ひとこと要約

本稿では、滑らかな解析フレームワークを用いて、任意の多項式サイズの決定木が、大多数の積分布から PAC-学習可能であることを示している。各積分布のバイアスパラメータに小さなランダムな摂動を加えることで、著者らは、元の分布が一様でない場合でも、高確率で多項式時間アルゴリズムが任意の決定木を学習できることを示している。

ABSTRACT

We consider the problem of PAC-learning decision trees, i.e., learning a decision tree over the n-dimensional hypercube from independent random labeled examples. Despite significant effort, no polynomial-time algorithm is known for learning polynomial-sized decision trees (even trees of any super-constant size), even when examples are assumed to be drawn from the uniform distribution on {0,1}^n. We give an algorithm that learns arbitrary polynomial-sized decision trees for {\em most product distributions}. In particular, consider a random product distribution where the bias of each bit is chosen independently and uniformly from, say, [.49,.51]. Then with high probability over the parameters of the product distribution and the random examples drawn from it, the algorithm will learn any tree. More generally, in the spirit of smoothed analysis, we consider an arbitrary product distribution whose parameters are specified only up to a [-c,c] accuracy (perturbation), for an arbitrarily small positive constant c.

研究の動機と目的

  • 一般の積分布下での多項式サイズの決定木に対する PAC-学習という長年の未解決問題に取り組むこと。
  • 分布が最小限のランダムな摂動を受けることで学習が可能になること、最悪ケースや一様分布の仮定に依存しないことの示唆。
  • 滑らかな解析を活用して、Kushilevitz-Mansour (KM) アルゴリズムの適用範囲を一様分布を超えて拡張すること。
  • 決定木学習が最悪ケースの難解性結果にもかかわらず、実用的になぜ tractable に可能であるかの理論的基盤を提供すること。
  • 摂動モデル下でのアグノスティック学習や積分布を超えた学習設定への新しい研究方向性を開くこと。

提案手法

  • 各ビットのバイアスが一様分布 [-c, c] からの小さなランダムな摂動を受ける滑らかな解析モデルを導入する。
  • 摂動された積分布から得られるランダムな例に適応した Kushilevitz-Mansour (KM) アルゴリズムフレームワークを用いる。
  • 超立方体上のフーリエ解析を用いて、決定木関数の高次フーリエ係数の影響を制限する。
  • チェルノフ=フーリエ境界を適用し、実際のフーリエ係数が高確率で経験的係数と一致することを保証する。
  • 深さ d で決定木を切り詰めることで、高次項の L2 マスを制限し、関数の分散に寄与するのは主に低次項であることを示す。
  • 小さい大きさのフーリエ係数の数が限られていることを証明し、サンプリングによる効率的推定が可能であることを示す。

実験結果

リサーチクエスチョン

  • RQ1一様分布の仮定が成り立たない場合でも、多項式サイズの決定木は、大多数の積分布から PAC-学習可能か?
  • RQ2積分布のパラメータに小さなランダムな摂動を加えることで、決定木学習が滑らかな解析モデル下で tractable になるか?
  • RQ3滑らかな解析フレームワークは、決定木の PAC 学習における最悪ケースの制限をどの程度克服できるか?
  • RQ4KM アルゴリズムは、一様分布やブラックボックスアクセスに限定されず、摂動された積分布に対しても効率的に動作するように拡張可能か?
  • RQ5滑らかな解析アプローチを積分布でない分布や、アグノスティック学習のようなより複雑な学習設定に一般化可能か?

主な発見

  • 任意の定数 c ∈ (0, 1/4) に対して、任意のサイズ s の決定木 f について、m = poly(ns/(δε)) 個の例が摂動された積分布から得られ、高確率で f が学習可能である。
  • アルゴリズムは、摂動 Δ と学習データの両方の確率的変動に対して、Pr_{x∼P_μ}[h(x) ≠ f(x)] ≤ ε を満たす多項式しきい値関数 h を出力する。
  • 主な技術的貢献は、決定木の高次フーリエ係数の L2 マスが (1−c)^d * s で抑えられ、深さ d とともに指数関数的に減少することの証明である。
  • 小さい大きさのフーリエ係数の数は限られているため、真の分布が一様でない場合でも、サンプリングによる効率的推定が可能である。
  • アルゴリズムは poly(n, m) 時間で実行可能であり、滑らかな解析モデル下では多項式時間かつ実用的である。
  • この結果は、PAC 学習における一様分布の仮定が、従来考えられていたように学習を単純化しない可能性を示唆している。なぜなら、わずかな摂動ですでに学習が tractable になるからである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。