Skip to main content
QUICK REVIEW

[論文レビュー] Learning from Multiple Corrupted Sources, with Application to Learning from Label Proportions

Clayton Scott, Jianxin Zhang|arXiv (Cornell University)|Oct 10, 2019
Machine Learning and Data Classification参考文献 30被引用数 5
ひとこと要約

本稿では、標本サイズやラベルノイズ度合いが異なる複数のバイナリ分類データセットからの学習のため、ノイズ補正済み経験的リスクの重み付き組み合わせを提案する。標本サイズとノイズ度合いに基づいて重みを最適化することで、既知の最もタイトな一般化誤差バウンドを達成し、ラベル比率(LLP)からの学習における最も包括的な統計的一致性の保証を提供する。

ABSTRACT

We study binary classification in the setting where the learner is presented with multiple corrupted training samples, with possibly different sample sizes and degrees of corruption, and introduce an approach based on minimizing a weighted combination of corruption-corrected empirical risks. We establish a generalization error bound, and further show that the bound is optimized when the weights are certain interpretable and intuitive functions of the sample sizes and degrees of corruptions. We then apply this setting to the problem of learning with label proportions (LLP), and propose an algorithm that enjoys the most general statistical performance guarantees known for LLP. Experiments demonstrate the utility of our theory.

研究の動機と目的

  • 標本サイズやノイズ度合いが異なる複数の独立的に汚染されたバイナリ分類データセットからの学習の課題に対処する。
  • 単一ソースのラベルノイズ補正とラベル比率からの学習(LLP)の両方を一般化する統一フレームワークを構築する。
  • 複数の汚染されたソースに学習させたカーネルベースの予測子に対する分布フリーな一般化誤差バウンドを確立する。
  • 弱教師付き学習における分類性能の普遍的一致性を理論的に保証する。
  • LLPにこのフレームワークを適用し、解釈可能で最適化された重み付けスキームを用いて、これまでで最も包括的な統計的分析を提供する。

提案手法

  • 各ソースが既知または推定されたラベルノイズに対応して調整された損失関数を寄与する、ノイズ補正済み経験的リスクの重み付き和を定式化する。
  • リーマンチェル複雑度を用いて一般化誤差バウンドを導出する。これはリプシッツ損失関数および任意の重みに対して有効である。
  • 一般化誤差バウンドを最小化するように重みを解析的に最適化し、各ソースにおける正例と負例の割合の差の二乗に比例する閉形式の式を得る。
  • 各バッグを既知のラベル割合を持つ汚染されたデータソースとしてモデル化することで、LLPにフレームワークを適用し、問題を複数ソース学習に還元する。
  • レプレスエンターザムの定理を用いて、再生ヒルバート空間内での解を表現し、勾配降下法によるカーネルベースの学習を可能にする。
  • 理論的予測に基づいて最適なバッグペアリングと重み割り当てを実装し、重みがゼロ(すなわち、バランスの取れた割合)であるペアを除外する。

実験結果

リサーチクエスチョン

  • RQ1標本サイズやノイズ度合いが異なる複数の汚染されたデータセットからの情報は、バイナリ分類においてどのように最適に集約できるか?
  • RQ2一般化誤差を最小化するための理論的最適重み付けスキームは、複数の汚染されたソースに対してどのように定義されるか?
  • RQ3提案されたフレームワークは、ラベル比率(LLP)からの学習において、従来の手法よりも強い統計的保証を提供できるか?
  • RQ4ラベル比率による弱教師付き学習において、分類性能の普遍的一致性が達成されるか?
  • RQ5ノイズ度合いと標本サイズに基づく理論的重み最適化は、実験的に従来のLLPアルゴリズムと比較してどのように異なるか?

主な発見

  • 提案手法は、リーマンチェル複雑度を用いて導出された、複数の汚染されたソースからの学習における既知で最もタイトな一般化誤差バウンドを達成する。
  • 最適な重みは、各ソースにおける正例と負例の割合の差の二乗に比例する解析的式として導出され、解釈可能で直感的な集約ルールを提供する。
  • フレームワークは分類性能の測定基準に関して普遍的一致性を確立し、従来のLLP手法よりも強い保証を提供する。
  • 実験結果では、補正済み損失アプローチが、8つのUCIデータセットと複数のバッグサイズで20回の実験のうち16回でバランス精度においてInvCalおよびalternate-∝ SVMを上回る。
  • ラベル割合が完全でない場合でも、本手法は強力な性能を維持し、先行研究の制限的な仮定(例:純粋なバッグ、有限の特徴空間)を回避する。
  • 理論的分析はLLPにとどまらず、一般の特徴依存ラベルノイズへと拡張され、この設定における最初の分布フリーな一般化誤差バウンドを提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。