Skip to main content
QUICK REVIEW

[論文レビュー] Distinguishing Question Subjectivity from Difficulty for Improved Crowdsourcing

Yuan Jin, Mark Carman|arXiv (Cornell University)|Feb 12, 2018
Mobile Crowdsensing and Crowdsourcing参考文献 21被引用数 3
ひとこと要約

本稿では、主観性と難易度を明示的にモデル化し、潜在的な作業者好み要因を通じて主観性を暗黙的に捉える確率的枠組みであるSDR(Subjectivity-and-Difficulty Response)モデルを提案する。主観的ばらつきと客観的難易度を区別することで、多様なクラウドソーシングデータセットにおいて正答の質の予測および作業者応答の予測が向上し、人間による検証が行われた難易度および主観性の順序付けが一貫性を持って得られる。

ABSTRACT

The questions in a crowdsourcing task typically exhibit varying degrees of difficulty and subjectivity. Their joint effects give rise to the variation in responses to the same question by different crowd-workers. This variation is low when the question is easy to answer and objective, and high when it is difficult and subjective. Unfortunately, current quality control methods for crowdsourcing consider only the question difficulty to account for the variation. As a result,these methods cannot distinguish workers personal preferences for different correct answers of a partially subjective question from their ability/expertise to avoid objectively wrong answers for that question. To address this issue, we present a probabilistic model which (i) explicitly encodes question difficulty as a model parameter and (ii) implicitly encodes question subjectivity via latent preference factors for crowd-workers. We show that question subjectivity induces grouping of crowd-workers, revealed through clustering of their latent preferences. Moreover, we develop a quantitative measure of the subjectivity of a question. Experiments show that our model(1) improves the performance of both quality control for crowd-sourced answers and next answer prediction for crowd-workers,and (2) can potentially provide coherent rankings of questions in terms of their difficulty and subjectivity, so that task providers can refine their designs of the crowdsourcing tasks, e.g. by removing highly subjective questions or inappropriately difficult questions.

研究の動機と目的

  • 既存の品質管理手法が、主観性による作業者間の合意不一致と難易度に起因する誤りを混同するという限界を是正すること。
  • 質問の主観性を固定された性質としてではなく、応答パターンに基づいて作業者をクラスタリングする潜在的好み要因としてモデル化すること。
  • 難易度と主観性を別々に推定できる統一的な確率的枠組みを構築し、正答と個々の作業者応答の両方の予測を向上させること。
  • 人間の評価と整合する質的測定値としての質問の主観性を提供すること。
  • タスク提供者が難易度が高すぎるか、主観的すぎる質問を特定・改善できるように、タスク設計を支援すること。

提案手法

  • SDRモデルは、各質問における作業者の熟練度および好み要因を表す潜在変数を有する確率的グラフィカルモデルを用いる。
  • 質問の難易度は、正しい応答の確率に直接影響を与えるパラメータとしてモデル化される。
  • 主観性は、部分的に主観的な質問に対する応答パターンに基づいて、作業者をクラスタリングする潜在好み要因を通じて暗黙的に符号化される。
  • ベイズ推論アプローチを用いて、同時に作業者の熟練度、好み要因、質問の難易度および主観性パラメータを推定する。
  • 複数選択肢の質問における応答相関構造を活用することで、推定精度およびクラスタ検出を向上させる。
  • モデル推定値と人間がアノテートした難易度および主観性の順序付けを比較する新規な整合性評価手法を用い、モデルの解釈可能性を検証する。

実験結果

リサーチクエスチョン

  • RQ1確率的モデルは、クラウドソーシングタスクにおいて、質問の主観性に起因する作業者間の合意不一致と、難易度に起因する合意不一致を効果的に区別できるか?
  • RQ2潜在的作業者好み要因を通じて主観性を暗黙的にモデル化できるか。また、そのようなモデル化により、作業者の明確なクラスタリングが検出可能か?
  • RQ3SDRモデルは、既存のベースラインと比較して、正答の予測および個々の作業者応答の予測精度をどの程度向上させるか?
  • RQ4モデルが推定する難易度および主観性は、人間がアノテートした順序付けと意味的に相関しているか?
  • RQ5モデルは、難易度および主観性のレベルに基づいて質問を特定・順序付けでき、タスク設計を支援できるか?

主な発見

  • SDRモデルは、7つの部分的に主観的なデータセットにおいて、5つのベースラインと比較して、未観測の作業者応答を予測する性能が顕著に優れており、平均正答率で1.5–2.5%の向上を達成した。
  • ネーメニ氏の事後検定により、SDRと他のすべてのモデル(CDS、GLAD、DS、MdWC)との間の性能差は、有意水準α=0.10で統計的に有意であると確認された。
  • ファッショングループデータセットにおいて、SDRモデルは未観測応答の予測で平均正答率0.7659を達成し、次に優れたモデル(CDS)の0.7621を上回った。
  • SDRが推定した主観性と人間が割り当てた順位との間に強い負の相関(r ≈ -0.85)が確認され、主観性の測定における妥当性が裏付けられた。
  • モデルは、ファッション判断タスクにおいて、異なる好みパターンに対応する3つの明確な作業者グループを同定し、主観性に起因するクラスタリングが生じていることを明らかにした。
  • 人間のアセッサーによる難易度および主観性の順位は、SDRの推定値と強く一致しており、難易度についてr ≈ 0.82、主観性についてr ≈ 0.88の正の相関が確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。