Skip to main content
QUICK REVIEW

[論文レビュー] Nonparametric semi-supervised learning of class proportions

Shantanu Jain, Martha White|arXiv (Cornell University)|Jan 8, 2016
Machine Learning and Data Classification参考文献 34被引用数 18
ひとこと要約

本稿では、2成分混合モデルにおける混合割合の推定として問題を定式化することにより、非パラメトリックな半教師付き手法を提案し、正例-負例学習におけるクラス割合の推定を実現する。同定性を保証するための最大正準形を導入し、クラス事前分布を保持する変換を用いた最尤推定に基づくアルゴリズムを構築することで、高次元データに対しても優れた精度を達成し、合成データおよび実世界のデータセットにおいて、最先端の手法を上回る性能を示した。

ABSTRACT

The problem of developing binary classifiers from positive and unlabeled data is often encountered in machine learning. A common requirement in this setting is to approximate posterior probabilities of positive and negative classes for a previously unseen data point. This problem can be decomposed into two steps: (i) the development of accurate predictors that discriminate between positive and unlabeled data, and (ii) the accurate estimation of the prior probabilities of positive and negative examples. In this work we primarily focus on the latter subproblem. We study nonparametric class prior estimation and formulate this problem as an estimation of mixing proportions in two-component mixture models, given a sample from one of the components and another sample from the mixture itself. We show that estimation of mixing proportions is generally ill-defined and propose a canonical form to obtain identifiability while maintaining the flexibility to model any distribution. We use insights from this theory to elucidate the optimization surface of the class priors and propose an algorithm for estimating them. To address the problems of high-dimensional density estimation, we provide practical transformations to low-dimensional spaces that preserve class priors. Finally, we demonstrate the efficacy of our method on univariate and multivariate data.

研究の動機と目的

  • 負例が入手不可能または入手不能である正例-負例学習におけるクラス事前分布推定の課題に取り組む。
  • クラス事前分布推定を、2成分混合モデルにおける混合割合の学習という非パラメトリックな問題に定式化する。
  • 同定性の問題を解消するため、一意な解を保証しながらも柔軟性を維持する正準形の導入により、混合割合推定の同定性を確保する。
  • 次元削減によるクラス事前分布の保持を可能にする、実用的で高次元の密度推定技術を開発する。
  • 1変量および多変量データにおいて、提案手法を既存の最先端手法と比較して実験的に検証する。

提案手法

  • クラス事前分布推定を、2成分混合モデルにおける混合割合 α の学習問題として定式化:f(x) = αf₁(x) + (1−α)f₀(x)。ここで f₁ は正例データから得られ、f は無作為ラベル付きデータから推定される。
  • 混合密度と成分密度の最大値が共通点で一致するように正規化することで、同定性を強制する最大正準形を導入する。
  • 正準形に基づく尤度関数を導出し、正準空間における対数尤度の凸性の性質を活用して、α の最尤推定を最適化する。
  • 分類器スコアの使用などを通じて、高次元データを密度推定が可能で正確な1変量空間に射影するクラス事前分布を保持する変換を提案する。
  • 変換された空間における非パラメトリック密度近似にカーネル密度推定を用い、交差検証やプラグイン法によるバンド幅選択を支援する。
  • 対数尤度プロットを用いて、最適な α の指標として屈曲点を検出する。ノイズの多い状況でもロバスト性を高めるためのヒューリスティクスを導入する。

実験結果

リサーチクエスチョン

  • RQ1成分密度にパラメトリックな仮定を設けない状況下でも、2成分混合モデルにおける混合割合推定を同定可能にすることができるか?
  • RQ2高次元設定において密度推定が困難である状況でも、クラス事前分布の非パラメトリック推定をどのようにしてロバストに実現できるか?
  • RQ3次元削減を実現しつつクラス事前分布を保持する変換戦略は何か?
  • RQ4提案手法は、クラス事前分布推定における既存の教師ありおよび教師なし手法と比較して、精度で優れているか?
  • RQ5最大正準形が α の一貫した推定を保証する理論的および実験的条件は何か?

主な発見

  • 提案手法 AlphaMax は、12個の UCI データセットにおいて平均絶対誤差(MAE)が最小であり、12個中10個のデータセットでMAEが常に0.05未満であった。また、12回の比較のうち9回で統計的に優位であった。
  • waveform および ball-in-the-box データセットにおいて、α=0.05 の条件下で MAE がそれぞれ 0.004 と 0.004 にまで低下し、pdf比法およびcdfベース手法(p<0.05)を著しく上回った。
  • Gas(127次元)および Spambase(57次元)といった高次元データにおいて、AlphaMax はそれぞれ MAE 0.018 および 0.066 を達成した。これに対して pdf比法は 0.335 および 0.116、cdfベース手法は 0.137 および 0.027 を示した。
  • 最大正準形により、元の混合モデルが同定不能であっても、α の安定的かつ一意な推定が可能であり、理論的および実験的検証を通じて同定性が裏付けられた。
  • スケーリングや多峰性を持つ密度分布を含む多様なデータ分布に対してロバストであることが示され、α の値が 0.05 から 0.95 の範囲で一貫した性能を発揮した。
  • 分類器スコアに基づく変換を用いることで、クラス事前分布を効果的に保持でき、直接的な多変量密度推定が困難な高次元設定でも正確な推定が可能になった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。