Skip to main content
QUICK REVIEW

[論文レビュー] Efficient PAC Learning from the Crowd

Pranjal Awasthi, Avrim Blum|arXiv (Cornell University)|Mar 21, 2017
Machine Learning and Algorithms被引用数 4
ひとこと要約

本稿では、ラベル付けと学習プロセスを統合することで、1例あたりのラベル付けオーバーヘッドが一定である計算的に効率的なPAC学習のための新しいフレームワークを提案する。これは、グラフベースのモデルを用いてラベル付け者の間の不一致をテストすることで、信頼できるラベル付け者を同定することにより達成される。その結果、信頼できるラベル付け者が過半数である場合でも、高い分類精度を維持できる。

ABSTRACT

In recent years crowdsourcing has become the method of choice for gathering labeled training data for learning algorithms. Standard approaches to crowdsourcing view the process of acquiring labeled data separately from the process of learning a classifier from the gathered data. This can give rise to computational and statistical challenges. For example, in most cases there are no known computationally efficient learning algorithms that are robust to the high level of noise that exists in crowdsourced data, and efforts to eliminate noise through voting often require a large number of queries per example. In this paper, we show how by interleaving the process of labeling and learning, we can attain computational efficiency with much less overhead in the labeling cost. In particular, we consider the realizable setting where there exists a true target function in $\mathcal{F}$ and consider a pool of labelers. When a noticeable fraction of the labelers are perfect, and the rest behave arbitrarily, we show that any $\mathcal{F}$ that can be efficiently learned in the traditional realizable PAC model can be learned in a computationally efficient manner by querying the crowd, despite high amounts of noise in the responses. Moreover, we show that this can be done while each labeler only labels a constant number of examples and the number of labels requested per example, on average, is a constant. When no perfect labelers exist, a related task is to find a set of the labelers which are good but not perfect. We show that we can identify all good labelers, when at least the majority of labelers are good.

研究の動機と目的

  • ラベル付けと学習が分離されている従来のクラウドソーシング学習における計算の非効率性と高コストの問題に対処する。
  • 信頼できるラベル付け者が少数である場合に顕著なノイズが生じるクラウドソーシングデータの課題を克服する。
  • 1例あたりのラベル数と1ラベル付け者あたりのラベル数を最小限に抑えつつ、計算効率を維持する学習アルゴリズムを設計する。
  • 信頼できる(良い)ラベル付け者をすべて同定する。信頼できるラベル付け者が半数を超える場合に、任意のノイズを受ける悪意のあるラベル付け者に対しても同様に有効である。
  • 1例あたりおよび1ラベル付け者あたりのラベル付けオーバーヘッドを一定に保つ。これにより、実世界のクラウドソーシング環境におけるスケーラブルで実用的な展開が可能になる。

提案手法

  • ラベル付け者をノードとし、ラベル付け者間の低不一致をエッジで表すグラフとしてクラウドをモデル化する。
  • 未ラベル化されたテストセット(サイズ $O(\frac{1}{\epsilon}\ln(\frac{n}{\delta}))$)上で、ラベル付け者ペアの不一致を推定するためにランダムサンプリングを用いる。
  • チェルノフ不等式を適用して、経験的不一致推定値が真の不一致に高い確率で近いことを保証する。
  • 不一致推定値が $2.5\epsilon$ 未満であるラベル付け者ペア間にエッジを追加することで、グラフを段階的に構築する。
  • サイズが $n/4$ 以上の連結成分を、候補となる良いラベル付け者クラスタとして特定する。
  • 大きな成分の代表者との不一致をテストすることで、追加の検証ステップを実施し、小さな成分を大きなものに統合する。

実験結果

リサーチクエスチョン

  • RQ1信頼できるラベル付け者が少数である場合でも、計算的に効率的なクラウドからのPAC学習を達成できるか?
  • RQ2信頼できるラベル付け者が半数を超える場合に、1ラベル付け者あたり定数個のクエリのみを用いて、すべての良いラベル付け者を同定できるか(誤差 $\leq \epsilon$)?
  • RQ3高ノイズ下でも、実現可能なPAC設定において、1例あたりのラベルコストを最適値の定数倍にまで低減できるか?
  • RQ4悪意のあるラベル付け者による誤検出(偽陽性)を回避しながら、良いラベル付け者を信頼性高くクラスタリングするグラフベースのアルゴリズムをどのように設計できるか?
  • RQ5高い確率ですべての良いラベル付け者を同定するために、1ラベル付け者あたりに必要な期待クエリ負荷はどの程度か?

主な発見

  • 信頼できるラベル付け者が半数を超える場合に、誤差が $\epsilon$ 未満である限り、提案アルゴリズムは確率 $1 - \delta$ ですべての良いラベル付け者を同定する。
  • アルゴリズムは、信頼できるラベル付け者が1つの大きな成分(サイズ $n/4$ 以上)に接続されることを保証し、信頼性の高い同定を可能にする。
  • 1ラベル付け者あたりの期待ラベル数は $O\left(\frac{1}{\epsilon}\ln\left(\frac{n}{\delta}\right)\right)$ であり、固定された $\epsilon$ と $\delta$ に対しては定数となる。
  • 1例あたりのラベル総数は定数であり、実現可能なPAC設定と比較して $O(1)$ のオーバーヘッドを達成する。
  • 信頼できるラベル付け者が十分に多数かつ正確である限り、悪意のあるラベル付け者の任意の振る舞いに対しても、この手法はロバストである。
  • 集中不等式(チェルノフ不等式)とランダムグラフ理論を用いて理論的保証を確立し、高い確率での正しさを保証する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。