Skip to main content
QUICK REVIEW

[論文レビュー] The 'Problem' of Human Label Variation: On Ground Truth in Data, Modeling and Evaluation

Barbara Plank|arXiv (Cornell University)|Nov 4, 2022
Machine Learning and Data Classification被引用数 9
ひとこと要約

この論文は、主観性、曖昧さ、あるいは複数の妥当な解釈が原因で生じる人間のラベル変動——つまり、誤りではなく妥当な差異——をノイズではなく、情報として扡用すべきだと主張する。本稿では、ラベル変動を保持する機械学習パイプライン全体にわたるデータセットのモデリング、評価、キュレーションを統合的に扱うフレームワークを提案し、多数決によるラベル集約を行わない、公開可能なデータセットの包括的かつコミュニティメンテナンス型リポジトリを提供することで、多数決を超えた研究を可能にする。

ABSTRACT

Human variation in labeling is often considered noise. Annotation projects for machine learning (ML) aim at minimizing human label variation, with the assumption to maximize data quality and in turn optimize and maximize machine learning metrics. However, this conventional practice assumes that there exists a ground truth, and neglects that there exists genuine human variation in labeling due to disagreement, subjectivity in annotation or multiple plausible answers. In this position paper, we argue that this big open problem of human label variation persists and critically needs more attention to move our field forward. This is because human label variation impacts all stages of the ML pipeline: data, modeling and evaluation. However, few works consider all of these dimensions jointly; and existing research is fragmented. We reconcile different previously proposed notions of human label variation, provide a repository of publicly-available datasets with un-aggregated labels, depict approaches proposed so far, identify gaps and suggest ways forward. As datasets are becoming increasingly available, we hope that this synthesized view on the 'problem' will lead to an open discussion on possible strategies to devise fundamentally new directions.

研究の動機と目的

  • 人間のラベル変動を最小化すべきノイズであるという従来の仮定に挑戦し、代わりにそれが人間の解釈の多様性を反映していると主張する。
  • ラベル変動、不一致、曖昧さといった散在する概念を、すべて「人間のラベル変動」(Hlv)という用語で統合する。
  • Hlvを無視することで、NLPおよび機械学習におけるデータキュレーション、モデル開発、評価の進展が制限されることを示す。
  • 複数のラベルや不一致を研究できるように、未集約の人的ラベルを保持したデータセットを一元管理する、中央集権的かつコミュニティが更新するリポジトリを提供する。
  • 人間の差異を考慮するモデルと評価手法へのパラダイムシフトを提唱し、人間中心のAIにおける包括性と信頼性を高める。

提案手法

  • 曖昧さ、主観性、あるいは複数の正しい答えが存在する場合に生じる、誤りではない妥当な人的ラベルの変動を「人間のラベル変動」(Hlv)として定義・導入する。
  • 文献に散在する概念(不一致、主観性、複数の妥当な答えなど)を、Hlvという統一的枠組みで統合する。
  • 三段階のフレームワークを提案する:(1) 未集約ラベルを保持するデータキュレーション、(2) 単一のゴールドラベルではなくラベル分布を考慮するモデリング、(3) 単一の正解ではなく複数の参照ラベルを用いた評価。
  • NLP、CV、NLIタスクの例を含め、未集約の人的ラベルを保持するデータセットの公開およびメンテナンスを実施する。
  • 既存のデータセット(例:Phrase Detectives、GoEmotions、ChaosNLI、CommitmentBank)を用いて、Hlvの実際の例を提示し、フレームワークの有効性を検証する。
  • 共有タスク(例:SemEval 2023 LeWiDi)への統合や多数決との比較によるベンチマークを通じて、Hlvに配慮した手法の採用を促進する。

実験結果

リサーチクエスチョン

  • RQ1人間のラベル変動は、機械学習パイプラインにおけるデータ品質、モデル性能、評価指標にどのように影響を与えるか?
  • RQ2人間のラベル変動とアノテーションエラーの違いは何か? そして、この区別がモデル開発においてなぜ重要なのか?
  • RQ3複数の人的ラベルを用いて学習したモデルは、多数決によるゴールドラベルを用いたモデルよりも、曖昧または主観的なタスクで優れた性能を示せるか?
  • RQ4人間のラベル変動を保存し、研究を可能にするために、データセットはどのようにキュレーション・共有されるべきか?
  • RQ5複数の人的ラベルが妥当な状況下で、モデルを公正に評価するためには、どのような新しい評価プロトコルが必要か?

主な発見

  • 人間のラベル変動は、NLPおよびCVタスクにおいて広く見られ、特に毒性検出、感情認識、語義意味の分類といった主観的または曖昧なタスクで顕著である。
  • Phrase Detectives、GoEmotions、ChaosNLI、CommitmentBank など、未集約ラベルを含む多数のデータセットが公開されており、Hlv研究を支援している。
  • 既存のベンチマークや共有タスク(例:SemEval 2023 LeWiDi)は、すでにHlvに配慮した評価を導入しており、コミュニティの関心と実現可能性を示している。
  • ChaosNLI や Phrase Detectives のようなデータセットでは、明確なタスクにおいても、20–30%のインスタンスでアノテーター間で是正不能な不一致が生じており、顕著なHlvが存在することが示された。
  • 単一のゴールドラベルではなく、ラベル分布を学習対象としたモデルは、曖昧性の高いタスクにおいて、最近の TACL や JAIR の研究で示されるように、より高い耐性と一般化性能を示した。
  • Hlvデータセットのリポジトリ(https://github.com/mainlp/awesome-human-label-variation)は、すでに複数の高影響力研究で利用されており、その実用性とコミュニティの受容を裏付けている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。