Skip to main content
QUICK REVIEW

[論文レビュー] Learning in the Presence of Corruption

Brendan van Rooyen, Robert C. Williamson|arXiv (Cornell University)|Apr 1, 2015
Corruption and Economic Development参考文献 32被引用数 9
ひとこと要約

本稿は、統計的決定理論を用いてラベルの不正な状態下における教師あり学習を分析する一般化されたフレームワークを導入し、定常性係数と一般化された不偏推定量法を用いて、リスクの新たな上限および下限を導出する。本稿は、特に、0-1損失と分離可能なデータに対して、対称的ラベルノイズ下でも高速な学習レートが保持されることを示し、ラベル不正が存在する場合でも高速な学習レートが維持される条件を確立する。

ABSTRACT

In supervised learning one wishes to identify a pattern present in a joint distribution $P$, of instances, label pairs, by providing a function $f$ from instances to labels that has low risk $\mathbb{E}_{P}\ell(y,f(x))$. To do so, the learner is given access to $n$ iid samples drawn from $P$. In many real world problems clean samples are not available. Rather, the learner is given access to samples from a corrupted distribution $ ilde{P}$ from which to learn, while the goal of predicting the clean pattern remains. There are many different types of corruption one can consider, and as of yet there is no general means to compare the relative ease of learning under these different corruption processes. In this paper we develop a general framework for tackling such problems as well as introducing upper and lower bounds on the risk for learning in the presence of corruption. Our ultimate goal is to be able to make informed economic decisions in regards to the acquisition of data sets. For a certain subclass of corruption processes (those that are \emph{reconstructible}) we achieve this goal in a particular sense. Our lower bounds are in terms of the coefficient of ergodicity, a simple to calculate property of stochastic matrices. Our upper bounds proceed via a generalization of the method of unbiased estimators appearing in recent work of Natarajan et al and implicit in the earlier work of Kearns.

研究の動機と目的

  • 異なる種類の不正なデータからの学習の難易度を比較するための一般化された理論的フレームワークを開発すること。
  • 訓練データが不正である場合の一般化リスクの上限および下限を提供することにより、データ品質の定量的比較を可能にすること。
  • 異なる不正なデータタイプの利便性をランク付けすることで、データ取得に関する情報に基づいた経済的意思決定を可能にすること。
  • 不正が存在する場合でも高速な学習レートが保持される条件を特定すること、特に0-1損失とラベルノイズに関して。
  • 不正なデータが学習効率の観点で、クリーンデータと同等に扱える条件を形式化すること。

提案手法

  • クリーンな観測空間から不正な観測空間への不正プロセスを、有限集合と確率的行列(ストキャスティック行列)としてのマルコフ核としてモデル化する。
  • 不正の深刻度の主要な指標として、確率的行列の定常性係数を用い、リスクの下限を導出する。
  • 先行研究における不偏推定量法を一般化し、不正に対してロバストな学習アルゴリズムの構築を可能にする。
  • 損失関数と不正核の間のη-適合性という概念を導入し、クリーンなリスクと不正なリスクの境界を関連付ける。
  • 合成性補題を用いて、複数の不正プロセス(例:ノイズのあるラベルと部分的なラベル)の組み合わせを分析する。
  • 一般化された不偏推定量の構築を用いて上界を導出し、定常性係数を用いて下界を導出し、両者をベルンシュタイン条件に基づいて記述する。

実験結果

リサーチクエスチョン

  • RQ1不正なデータからの学習において、どのような条件下で高速な学習レートが保持されるか?
  • RQ2ノイズのあるラベルや部分的なラベルなどの異なる種類の不正なデータを、学習の有用性の観点から定量的に比較できるか?
  • RQ3不正プロセス(マルコフ核として表現される)とそれによって生じる一般化リスクの間にはどのような関係があるか?
  • RQ4ベルンシュタイン条件は不正の影響を受けても保持されるか? もし保持されるなら、どのような条件下か?
  • RQ5不正核の定常性係数は、不正なデータからの学習の難易度とどのように関係するか?

主な発見

  • 本稿は、不正なデータからの学習におけるリスクの下限を、不正核の定常性係数の観点から確立する。
  • 一般化された不偏推定量法を用いたリスクの上界を提供し、これは先行研究[30]および[24]を拡張するものである。
  • 対称的ラベルノイズの下では、(0-1損失, 不正核)のペアはη-適合性を満たし、η = max((1+σ₋₁−σ₁)/(1−σ₋₁−σ₁))²を満たす。これによりベルンシュタイン条件の下で高速なレートが達成可能である。
  • クリーンなデータが定数Kでベルンシュタイン条件を満たし、不正がη-適合性を満たす場合、不正なデータは定数ηKでベルンシュタイン条件を満たす。
  • 本フレームワークにより、n個のクリーンなサンプルとn₁個のノイズのあるラベルおよびn₂個の部分的なラベルといった、異なるデータタイプの相対的な学習難易度を境界づけることができる。
  • 結果として、分離可能なデータと0-1損失の下では、特定の条件下で高速な学習レートが不正ラベルが存在する場合でも保持されることを示しており、ノイズのあるデータを効率的に使用する理論的根拠を提供する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。