Skip to main content
QUICK REVIEW

[論文レビュー] Generalization error for multi-class margin classification

Xiaotong Shen, Lifeng Wang|arXiv (Cornell University)|Aug 27, 2007
Face and Expression Recognition被引用数 7
ひとこと要約

本稿は、多クラスマージン分類における一般化誤差率の理論的枠組みを確立し、Fisher一貫性を回避する新しいアプローチを提案する。その焦点は、リスク最小化関数 f_V に置かれる。近似誤差と推定誤差に依存する一般化誤差の上界を導出し、線形分類では任意の高速収束率を示し、p ≪ exp(n) における高次元特徴選択に対しても収束率を提供する。

ABSTRACT

In this article, we study rates of convergence of the generalization error of multi-class margin classifiers. In particular, we develop an upper bound theory quantifying the generalization error of various large margin classifiers. The theory permits a treatment of general margin losses, convex or nonconvex, in presence or absence of a dominating class. Three main results are established. First, for any fixed margin loss, there may be a trade-off between the ideal and actual generalization performances with respect to the choice of the class of candidate decision functions, which is governed by the trade-off between the approximation and estimation errors. In fact, different margin losses lead to different ideal or actual performances in specific cases. Second, we demonstrate, in a problem of linear learning, that the convergence rate can be arbitrarily fast in the sample size $n$ depending on the joint distribution of the input/output pair. This goes beyond the anticipated rate $O(n^{-1})$. Third, we establish rates of convergence of several margin classifiers in feature selection with the number of candidate variables $p$ allowed to greatly exceed the sample size $n$ but no faster than $\exp(n)$.

研究の動機と目的

  • 二クラスを超える設定における多クラスマージン分類の一般化誤差の理論的枠組みを構築すること。
  • Fisher一貫性の制限を克服するため、ベイズ意思決定関数ではなくリスク最小化関数 f_V に注目すること。
  • 一般化性能における近似誤差と推定誤差のトレードオフを定量化すること。
  • p >> n だが p ≤ exp(n) である高次元設定におけるマージン分類器の収束率を確立すること。
  • 入出力ペairの連合分布に応じて、収束率が任意に高速になる可能性を示すこと。

提案手法

  • Fisher一貫性ではなく、Regret( f̂, f_V ) を直接的対象とする新しい理論的アプローチを提案。ここで f_V は候補関数集合 F 上でのリスク最小化関数である。
  • さまざまな二クラスマージン一般化の統一を図るための一般化された多クラスマージン損失を導入する。
  • 一般化誤差の上界を近似誤差(f_V と真のベイズ関数との距離)と推定誤差(有限標本によるずれ)を用いて導出する。
  • 点ごとの議論と凸解析を用いて収束のための条件を検証し、誤差の減衰率に関する仮定 A と B を含む。
  • 高次元特徴選択、特にスパース学習において、複雑性を制御するためのエントロピーに基づく技術を採用する。
  • 高次元空間における候補関数の増加を扱うために、エントロピー数 H_U(ε, G_p(s)) の上界を導出する。

実験結果

リサーチクエスチョン

  • RQ1多クラスマージン分類器の一般化性能を決定づける近似誤差と推定誤差のトレードオフは、どのように作用するか?
  • RQ2線形分類において、一般化誤差の収束率は任意に高速になる可能性があるか?その速度は何かによって決定されるか?
  • RQ3支配的クラスが存在する場合、多クラスマージン分類における一般化誤差にどのような影響を与えるか?
  • RQ4特徴数 p が標本サイズ n よりも著しく大きいが、exp(n) よりも速くは増加しない場合、マージン分類器の収束率はどのようになるか?
  • RQ5マージン損失の選択(凸または非凸)は、理想および実際の一般化性能にどのように影響を与えるか?

主な発見

  • 任意の固定されたマージン損失に対して、近似誤差と推定誤差の間には、一般化性能を支配するトレードオフが存在し、損失関数の種類によって最適な挙動が異なる。
  • 線形分類では、入出力ペアの連合分布に応じて、一般化誤差が n に依存して任意に高速に収束しうり、標準的な O(n⁻¹) のレートを上回る。
  • 線形分類では理想一般化性能(f_V に基づくもの)がより重要であるが、非線形設定では近似誤差が支配的になる。
  • p ≪ exp(n) における高次元特徴選択において、本稿は複数のマージン分類器について収束率を確立し、スパース学習におけるペナルティの役割を示した。
  • エントロピーに基づく複雑性制御を用いて理論的上界を導出し、スパース関数クラスに対して H_U(ε, G_p(s)) ≤ c(p log(1 + 1/(pε²)) + ε⁻² log(pε² + 1)) が成り立つことを示した。
  • 補題により、SVM や ψ学習を含むさまざまな損失関数のもとで、リスク最小化関数 f_V が存在し、良好に振る舞うことが確認された。特に支配的クラスが存在する場合でも同様である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。