Skip to main content
QUICK REVIEW

[論文レビュー] Ground-Truth, Whose Truth? -- Examining the Challenges with Annotating Toxic Text Datasets

Kofi Arhin, Ioana Baldini|arXiv (Cornell University)|Dec 7, 2021
Hate Speech and Cyberbullying Detection被引用数 7
ひとこと要約

本研究では、文脈依存性の毒性を捉え、アノテーションノイズを低減することで、有害テキストデータセットの品質を向上させるためのマルチラベルアノテーション手法を提案する。3つのデータセットを再アノテーションした結果、マルチラベルラベリングは外部の機械学習モデルとの整合性を高め、アノテーター間の一貫性を向上させるが、必ずしも従来のアノテーター間一致度指標を改善するわけではないことがわかった。

ABSTRACT

The use of machine learning (ML)-based language models (LMs) to monitor content online is on the rise. For toxic text identification, task-specific fine-tuning of these models are performed using datasets labeled by annotators who provide ground-truth labels in an effort to distinguish between offensive and normal content. These projects have led to the development, improvement, and expansion of large datasets over time, and have contributed immensely to research on natural language. Despite the achievements, existing evidence suggests that ML models built on these datasets do not always result in desirable outcomes. Therefore, using a design science research (DSR) approach, this study examines selected toxic text datasets with the goal of shedding light on some of the inherent issues and contributing to discussions on navigating these challenges for existing and future projects. To achieve the goal of the study, we re-annotate samples from three toxic text datasets and find that a multi-label approach to annotating toxic text samples can help to improve dataset quality. While this approach may not improve the traditional metric of inter-annotator agreement, it may better capture dependence on context and diversity in annotators. We discuss the implications of these results for both theory and practice.

研究の動機と目的

  • 単一ラベルアノテーションの限界、特に文脈依存性とアノテーターのバイアスに関する課題を調査すること。
  • マルチラベルアノテーションフレームワークが、有害テキスト分類におけるデータセット品質の向上とノイズ低減に寄与するかどうかを評価すること。
  • アノテーターのデモグラフィック要因、文脈、主観的解釈がラベルの一貫性と信頼性に与える影響を調査すること。
  • 将来の有害テキストデータセットおよびアノテーションプロトコルの設計を改善するための実行可能な提言を提供すること。
  • アノテーター間一致度を唯一のデータセット品質指標として過剰に依存するのをやめ、文脈に配慮したラベリングアプローチを提唱すること。

提案手法

  • 有害テキストアノテーションの問題を同定し、解決策を考案するため、デザインサイエンス研究(DSR)フレームワークを適用した。
  • 主な有害テキストデータセット3つ(例:SBIC、Jigsaw、ToxiGen)からそれぞれ100サンプルを再アノテーションし、マルチラベルアノテーション方式を用いた。
  • アノテーターが1つのテキストサンプルに対して複数のラベル(例:攻撃的、皮肉、偏見)を割り当てることを許可する構造化されたアノテーションガイドラインを採用した。
  • アノテーター内一貫性や外部機械学習モデルとの整合性といった指標を用いて、マルチラベル手法と従来の単一ラベルアノテーションを比較した。
  • 5名のアノテーターを用いた予備的一致性実験を通じて、マルチラベルフレームワーク下でのアノテーター内信頼性を評価した。
  • アノテーターのデモグラフィック要因と文脈的キーワードに基づくラベルの不一致を分析し、とくに内含的・微細な毒性の文脈に注目した。

実験結果

リサーチクエスチョン

  • RQ1文脈が有害テキストのラベリングにどのように影響するか。また、文脈の曖昧さによってアノテーターがどれほど不一致を示すか。
  • RQ2マルチラベルアノテーションフレームワークは、単一ラベルアノテーションと比較して、データセット品質の向上とノイズ低減に寄与するか。
  • RQ3マルチラベルアノテーションは、アノテーター間一致度が低くても、アノテーター内一貫性を高めるか。
  • RQ4アノテーターのデモグラフィック要因および文化的背景は、攻撃的または内含的な有害コンテンツのラベリング意思決定にどのように影響するか。
  • RQ5現在のデータセットは、文脈の欠如と単一ラベル制約の厳密さにより、ラベリングバイアスをどれほど反映しているか。

主な発見

  • 皮肉や風刺といった内含的毒性を示すテキストサンプルは、単一ラベル方式では頻繁に誤分類され、元のアノテーターが攻撃的とラベル付けした場合でさえも同様であった。
  • マルチラベルアプローチは外部機械学習モデルとの整合性を高め、複雑な毒性の次元をより適切に表現している可能性を示唆した。
  • マルチラベルフレームワーク下ではアノテーター内一貫性が向上し、個々のアノテーターが複数のラベルを割り当てることで信頼性が向上したことが示された。
  • アノテーター間一致度はマルチラベル化によって顕著に向上しなかったが、これは「高い一致度=高い品質」という仮定に疑問を呈するものであった。
  • 代表されていないグループに属するアノテーターは、最終的なラベルを拒否する傾向が強く、文化的・言語的背景が毒性の認識に与える影響を浮き彫りにした。
  • 攻撃的コンテンツの大部分は明示的な有害キーワードを欠いており、トーン、含意、文脈に依存していることが多く、キーワードベースのモデルでは検出が困難であることがわかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。