Skip to main content
QUICK REVIEW

[論文レビュー] GPM: A Generic Probabilistic Model to Recover Annotator's Behavior and Ground Truth Labeling

Jing Li, Suiyi Ling|arXiv (Cornell University)|Mar 1, 2020
Mobile Crowdsensing and Crowdsourcing参考文献 28被引用数 4
ひとこと要約

本稿では、真のラベルを単一の値ではなくカテゴリカル分布としてモデル化することにより、真のラベルとアノテーター行動を回復する汎用的確率的モデルGPMを提案する。潜在変数とEMに基づく最尤推定を用い、ランダム、繰り返し、悪意のあるなど、信頼性の低いアノテーターを検出する。離散的、連続的、順序的ラベリングタスクのあらゆる場面で、最先端のモデルを上回る精度と耐性を示す。

ABSTRACT

In the big data era, data labeling can be obtained through crowdsourcing. Nevertheless, the obtained labels are generally noisy, unreliable or even adversarial. In this paper, we propose a probabilistic graphical annotation model to infer the underlying ground truth and annotator's behavior. To accommodate both discrete and continuous application scenarios (e.g., classifying scenes vs. rating videos on a Likert scale), the underlying ground truth is considered following a distribution rather than a single value. In this way, the reliable but potentially divergent opinions from "good" annotators can be recovered. The proposed model is able to identify whether an annotator has worked diligently towards the task during the labeling procedure, which could be used for further selection of qualified annotators. Our model has been tested on both simulated data and real-world data, where it always shows superior performance than the other state-of-the-art models in terms of accuracy and robustness.

研究の動機と目的

  • クラウドソーシングデータラベリングにおけるノイズ、信頼性の低い、あるいは悪意のあるラベルの課題に対処すること。
  • 単一の真のラベル値を仮定するが、多様なアノテーター行動をモデル化できない既存のモデルの限界を克服すること。
  • 真のラベルを単一の値ではなくカテゴリカル分布としてモデル化することで、離散的、連続的、順序的ラベリングタスクにおいて、信頼性の高い真のラベル推定を可能にすること。
  • ランダム、繰り返し、悪意のあるなど、さまざまなタイプの信頼性の低いアノテーター行動を検出し、モデル化しつつ、信頼できるアノテーターの有効な相違意見を保持すること。
  • 現実世界およびシミュレートされたデータに適用可能な汎用的でスケーラブルなフレームワークを提供し、精度と耐性を向上させること。

提案手法

  • 真のラベルを単一の値ではなくカテゴリカル分布としてモデル化することで、コンセンサスと信頼できる相違意見を捉える。
  • アノテーターがラベリング中に信頼できる行動と信頼できない行動の間を切り替える確率を表す潜在変数を導入する。
  • 期待値最大化(EM)アルゴリズムを用いた最尤推定(MLE)により、真のラベル分布とアノテーター信頼性を同時に推定する。
  • 信頼性の低い行動(ランダム、繰り返し、逆転)をラベル上での一様分布としてモデル化し、パラメータ推定による検出を可能にする。
  • 真のラベル分布のエントロピーを用いてタスクの難易度を推定し、アクティブラベリング戦略の実装を可能にする。
  • 検証のため、シミュレート済みおよび現実世界のデータセット(例:顔の感情、MovieLens、Crowd Flower)に本モデルを適用する。

実験結果

リサーチクエスチョン

  • RQ1真のラベルを単一の値ではなく分布としてモデル化することで、離散的、連続的、順序的など多様なラベリングタスクにおいて、真のラベルを効果的に回復できるか?
  • RQ2現実のクラウドソーシング環境において、本モデルはランダム、繰り返し、悪意のあるなど、さまざまなタイプの信頼性の低いアノテーター行動を検出し、区別できるか?
  • RQ3本モデルが信頼できる相違意見をモデル化することで、すべての不一致をノイズとみなすモデルと比較して、真のラベル回復の精度がどの程度向上するか?
  • RQ4現実世界のデータセットにおいて、本モデルの精度と耐性は、最先端の手法(例:D&S、GLAD、Ord-bin)と比較してどの程度優れているか?
  • RQ5推定されたアノテーター信頼性とタスク難易度(エントロピーによる)は、アクティブラベリングやアノテーター選択などの後続応用に利用できるか?

主な発見

  • 顔の感情データセットでは、提案手法が分類精度(F1)0.5431を達成し、D&S(0.5356)とGLAD(0.5155)を上回り、最良の性能を示すOrd-binモデルと同等の性能を発揮した。
  • MovieLens 20Mデータセットでは、提案手法がPLCC 0.8620、SROCC 0.8420、RMSE 0.2228を達成し、D&S(PLCC: 0.4073、RMSE: 1.2287)とGLAD(RMSE: 0.6361)を著しく上回った。
  • Crowd Dogデータセットではスパム率が0%であったため、データの信頼性が非常に高く、複数のデータセットにおいてD&Sを上回る耐性を示した。
  • 連続的および順序的ラベリングタスクにおいて、本モデルの性能は一貫して優れており、特にD&SやGLADのような離散的ラベル専用モデルと比較して顕著に優位であった。
  • 推定された真のラベル分布は信頼できる相違意見を捉えており、タスク難易度はエントロピーを用いて効果的に推定された。これにより、アクティブラーニングへの応用が可能であると示唆された。
  • 本モデルは不規則なアノテーター行動に対しても耐性を示し、スパム率が低かった(MovieLensで1%、Crowd Dogで0%)。これは、低品質な貢献を効果的に同定・除外できることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。