Skip to main content
QUICK REVIEW

[論文レビュー] Computing the Shattering Coefficient of Supervised Learning Algorithms

Rodrigo Fernandes de Mello, Moacir Antonelli Ponti|arXiv (Cornell University)|May 7, 2018
Machine Learning and Algorithms参考文献 2被引用数 6
ひとこと要約

この論文は、h次元ヒルバート空間における教師あり学習アルゴリズムのシャッタリング係数について、1つまたは複数の(h-1)次元超平面を用いて閉形式の式を導出する。固定された超平面数と次元数において、成長関数が多項式的に増加することを証明し、経験的リスク最小化原理に従って経験的リスクが期待リスクに一様収束することを保証する。これにより、汎用的教師あり学習アルゴリズムの理論的学習保証が得られる。

ABSTRACT

The Statistical Learning Theory (SLT) provides the theoretical guarantees for supervised machine learning based on the Empirical Risk Minimization Principle (ERMP). Such principle defines an upper bound to ensure the uniform convergence of the empirical risk Remp(f), i.e., the error measured on a given data sample, to the expected value of risk R(f) (a.k.a. actual risk), which depends on the Joint Probability Distribution P(X x Y) mapping input examples x in X to class labels y in Y. The uniform convergence is only ensured when the Shattering coefficient N(F,2n) has a polynomial growing behavior. This paper proves the Shattering coefficient for any Hilbert space H containing the input space X and discusses its effects in terms of learning guarantees for supervised machine algorithms.

研究の動機と目的

  • h次元ヒルバート空間で動作する教師あり学習アルゴリズムのシャッタリング係数を形式的に導出すること。
  • シャッタリング係数が多項式的に増加する条件を確立し、経験的リスクが期待リスクに一様収束することを保証すること。
  • 分析をp個の超平面へ拡張し、それらが学習保証に与える影響を定量化すること。
  • 所望の一般化誤差バウンドを達成するために必要な最小のトレーニングサンプルサイズを計算する方法を提供すること。
  • 経験的リスク最小化原理を用いた教師あり学習アルゴリズムの一般化性能を評価する理論的基盤を提供すること。

提案手法

  • 1つの超平面が存在するh次元ヒルバート空間におけるシャッタリング係数を $ \mathcal{N}(F,2n) = 2\sum_{i=0}^{h}\binom{n-1}{i} $ として導出する。
  • 一般位置にあるデータポイントが超平面によってどのように分割されるかを組合せ幾何学的手法でモデル化し、分類器族が誘導する異なる二分類(dichotomies)の数を数える。
  • バプニク・チェルヴォネンキスの成長関数フレームワークを適用し、超平面によって定義される仮説空間の容量を分析する。
  • 二項不等式を用いて、個々のシャッタリング係数の積を上界で抑え、p個の超平面への拡張を実現する。
  • 一般化バウンドの対数および漸近的解析を適用し、サンプルサイズnの増加に伴う収束条件を導出する。
  • 不等式 $ \binom{m}{k} \leq \left(\frac{em}{k}\right)^k $ を用いて、単一および複数の超平面ケースにおけるシャッタリング係数の上界を導出する。

実験結果

リサーチクエスチョン

  • RQ1h次元ヒルバート空間で1つの(h-1)次元超平面を用いる教師あり学習アルゴリズムのシャッタリング係数の正確な形は何か?
  • RQ2サンプルサイズnが増加する際、シャッタリング係数はどのように漸近的に振る舞い、一般化にどのような含意を持つのか?
  • RQ3p個の超平面が存在する場合、成長関数およびそれによる学習保証にどのように影響を与えるか?
  • RQ4所望の一般化誤差バウンド $ \epsilon $ を高い確率で達成するために必要な最小のサンプルサイズは何か?
  • RQ5超平面ベースの分類器の文脈において、経験的リスクが期待リスクに一様収束する条件は何か?

主な発見

  • h次元ヒルバート空間における1つの超平面のシャッタリング係数は $ \mathcal{N}(F,2n) = 2\sum_{i=0}^{h}\binom{n-1}{i} $ であり、hが固定されている場合にnに関して多項式的に増加する。
  • シャッタリング係数の多項式的増加により、経験的リスク最小化原理における上界がn → ∞のとき0に収束し、一様収束が保証される。
  • p個の超平面の場合、シャッタリング係数は $ \left( \frac{2e(n-1)(e^h(n-1)^h - 1)}{e(n-1) - 1} + 2 \right)^p $ で上界が与えられ、hとpが固定されている場合に多項式的増加を維持する。
  • 一般化誤差バウンド $ \epsilon $ は $ \epsilon = \frac{2\sqrt{hp\log{n} + \gamma}}{\sqrt{n}} $ とスケーリングされ、hやpを増加させると $ \epsilon $ が大きくなり、一般化が難しくなることを示している。
  • n → ∞ のとき、バウンド内の補正項は消えるため、支配的項が $ -n\epsilon^2/4 $ であることが確認され、シャッタリング係数が多項式的に増加する場合に収束が保証される。
  • 導出されたバウンドにより、研究者が所望の $ \epsilon $-バウンドを99%の確率で達成するために必要な最小のサンプルサイズnを計算可能となる。例えば $ \epsilon = 0.05 $ の場合も同様に適用可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。