Skip to main content
QUICK REVIEW

[論文レビュー] Quality Enhancement by Weighted Rank Aggregation of Crowd Opinion

Sujoy Chatterjee, Anirban Mukhopadhyay|arXiv (Cornell University)|Aug 31, 2017
Mobile Crowdsensing and Crowdsourcing参考文献 9被引用数 4
ひとこと要約

本稿では、位置に基づくスコアと動的重み付けを用いて複数のアノテータの順位付けを統合することで、クラウドソーシングにおける真値予測を向上させる、新しい重み付き順位集約手法を提案する。人工的および実際のAMTデータセットにおいて、最先端の手法を上回り、RTEデータセットでは93.37%の精度を達成し、コンSENSUS形成における優れたロバスト性と正確性を示している。

ABSTRACT

Expertise of annotators has a major role in crowdsourcing based opinion aggregation models. In such frameworks, accuracy and biasness of annotators are occasionally taken as important features and based on them priority of the annotators are assigned. But instead of relying on a single feature, multiple features can be considered and separate rankings can be produced to judge the annotators properly. Finally, the aggregation of those rankings with perfect weightage can be done with an aim to produce better ground truth prediction. Here, we propose a novel weighted rank aggregation method and its efficacy with respect to other existing approaches is shown on artificial dataset. The effectiveness of weighted rank aggregation to enhance quality prediction is also shown by applying it on an Amazon Mechanical Turk (AMT) dataset.

研究の動機と目的

  • 単一の指標に依存するのではなく、複数のアノテータの順位付けを統合することで、クラウドソーシングにおける真値予測を改善すること。
  • 単一の品質指標に依存するか、アノテータの信頼性やバイアスを考慮しない既存の順位集約手法の限界を解消すること。
  • 類似度と適合度に基づいて順位付けの重要性を動的に割り当てる重み付き集約フレームワークを構築し、コンSENSUSの正確性を向上させること。
  • 制御されたノイズを含む合成データセットと実世界のAMTデータに対して、本手法の有効性を検証すること。

提案手法

  • 重み付きスピアマンのフットルール距離を用いて、入力順位付け間の類似度行列を計算し、最も類似したペアを特定する。
  • 親の順位付けの重みを用いて、対応するオブジェクトスコアの重み付き平均を計算することで、最も類似した2つの順位付けを統合する。
  • 統合された順位付けのスコアは、$\mathcal{MS}^{k} = \frac{w(R_1)\cdot a + w(R_2)\cdot b}{w(R_1)+w(R_2)}$ で計算され、ここで $a$ と $b$ は同一オブジェクトの2つの順位付けにおけるスコアである。
  • 新しい統合順位付けの重みは、過去のパフォーマンス(親の良さ)と現在の適合度(すべての入力順位付けとの類似度)を組み合わせて更新する。
  • 最も類似した順位付けを繰り返し統合することで、最終的に1つの集約順位付けが得られる。
  • オブジェクトが位置 $k$ に位置する場合の全体スコアは、$\mathcal{SC}_k = \frac{m^2 - 2mk - m}{2}$ で導出され、位置に基づく利益とペナルティスコアを組み合わせる。

実験結果

リサーチクエスチョン

  • RQ1提案手法の重み付き順位集約は、ノイズレベルが上昇する条件下でも、既存の順位集約手法と比較してどの程度ロバスト性を示すか?
  • RQ2精度、特異度、感度などの複数の特徴量を重み付き集約によって統合することで、クラウドソーシングにおける真値予測が向上するか?
  • RQ3提案手法は、実世界のクラウドソーシングデータセットにおいて、メジャリティ投票やMACEなどのベースライン手法をどの程度上回るか?
  • RQ4動的重み付けメカニズムは、コンSENSUS順位付けの品質向上にどの程度効果的か?

主な発見

  • 人工データセットでは、標準偏差0.02を伴い、AUC値が1.0406に達し、MC4、Robust RA、Bordaを含むすべての他の手法を上回った。
  • 実際のAMT RTEデータセットでは、93.37%の精度を達成し、メジャリティ投票(89.88%)、MACE(93.00%)、Raykar(93.00%)を上回った。
  • ノイズの高い入力順位付けに対しても、一貫した優位性を示し、高ノイズレベル下でも入力順位付けと高い類似度を維持した。
  • 過去のパフォーマンスと現在の適合度を組み合わせた動的重み更新メカニズムが、最終的な集約順位付けの安定性と正確性に顕著な貢献をした。
  • 位置に基づく利益とペナルティスコアの使用により、単純な投票や平均化よりも洗練され、正確な順位付けの統合が可能になった。
  • 結果から、複数の特徴量を考慮し、重み付き集約を適用することで、単一特徴量または非重み付き集約手法に依存するよりも、真値予測がより良くなることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。