Skip to main content
QUICK REVIEW

[论文解读] CrowdTruth 2.0: Quality Metrics for Crowdsourcing with Disagreement

Anca Dumitrache, Oana Inel|arXiv (Cornell University)|Aug 18, 2018
Mobile Crowdsensing and Crowdsourcing参考文献 5被引用 8
一句话总结

本文介紹了 CrowdTruth 2.0,一種將跨标注者分歧視為核心信號而非噪音的眾包框架。透過對工作者、輸入媒體單元與註解之間的相互依賴關係進行顯式建模,並運用向量化表示與加權分歧度量,該框架能精確評估工作者、註解與資料單元的品質,同時保留模糊性,而非強制達成共識。

ABSTRACT

Typically crowdsourcing-based approaches to gather annotated data use inter-annotator agreement as a measure of quality. However, in many domains, there is ambiguity in the data, as well as a multitude of perspectives of the information examples. In this paper, we present ongoing work into the CrowdTruth metrics, that capture and interpret inter-annotator disagreement in crowdsourcing. The CrowdTruth metrics model the inter-dependency between the three main components of a crowdsourcing system -- worker, input data, and annotation. The goal of the metrics is to capture the degree of ambiguity in each of these three components. The metrics are available online at https://github.com/CrowdTruth/CrowdTruth-core .

研究动机与目标

  • 解決傳統眾包方法將跨标注者分歧視為噪音並透過多數票強制達成共識的局限性。
  • 建模模糊性在眾包系統三大核心組件(工作者、輸入媒體單元、註解)之間的傳播方式。
  • 發展能區分因工作者品質低落所致分歧與因資料本身固有模糊性所致分歧的品質指標。
  • 提供一種有原則的、迭代式的計算方法,以相互依賴且依品質加權的方式計算工作者、註解與媒體單元的品質分數。
  • 在語義註解任務中,特別是在模糊或開放式情境下,保留人類觀點的完整多樣性。

提出的方法

  • 將每位工作者對某個媒體單元的註解表示為有限答案空間上的二值向量,從而形成工作者與媒體單元的向量。
  • 對於封閉式任務,答案空間為預先定義;對於開放式任務,答案空間則動態地從每個媒體單元的所有獨特註解中推導得出。
  • 使用基於餘弦距離的分歧度量計算品質分數,並依賴組件(如工作者品質、註解品質)的品質進行加權。
  • 定義關鍵指標:工作者-工作者協同度(WWA)、工作者-媒體單元協同度(WUA)、註解品質分數(AQS)與媒體單元-註解分數(UAS)。
  • 採用迭代式動態規劃方法,透過在工作者、註解與媒體單元品質之間形成相互依賴的迴圈反覆計算,直至收斂,以穩定品質分數。
  • 在所有指標中應用加權平均,以降低低品質工作者、註解或媒體單元對最終分數的影響。

实验结果

研究问题

  • RQ1如何將眾包中的跨标注者分歧有意義地解釋為模糊性的信號,而非噪音?
  • RQ2在多大程度上可以聯合評估工作者、註解與輸入媒體單元的品質,並考慮其相互依賴關係?
  • RQ3具備分歧感知能力的指標是否能提升模糊或開放式任務中眾包語義註解的可靠性?
  • RQ4模糊性在三種組件(工作者、資料、註解)之間的傳播如何影響對分歧的解釋?
  • RQ5依組件品質對分歧度量進行加權,對最終品質分數有何影響?

主要发现

  • CrowdTruth 2.0 的指標成功區分了因低品質工作者所致的分歧與因輸入資料本身真實模糊性所致的分歧。
  • 品質分數的迭代計算在收斂後穩定下來,且各次迭代間變異總和低於閾值,確保了指標輸出的可靠性。
  • 註解品質分數(AQS)僅適用於封閉式任務,其中所有媒體單元使用相同的註解集合,其計算方式為工作者對之間協同意願的條件機率加權平均。
  • 工作者-工作者協同度(WWA)指標使用工作者註解與其他工作者在共用媒體單元上的註解之間的餘弦距離加權平均,權重基於工作者與註解品質。
  • 工作者-媒體單元協同度(WUA)指標計算工作者註解與其他所有工作者在共用單元上的共識之間的相似度,並依媒體單元與註解品質加權。
  • 媒體單元-註解分數(UAS)透過合格工作者選擇該註解的加權比例,量化某則註解在特定媒體單元中表達的清晰程度。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。