Skip to main content
QUICK REVIEW

[論文レビュー] Capturing Ambiguity in Crowdsourcing Frame Disambiguation

Anca Dumitrache, Lora Aroyo|arXiv (Cornell University)|May 1, 2018
Topic Modeling被引用数 13
ひとこと要約

本稿では、FrameNetフレームの意味あいまいさを捉えるために、文ごとに複数のアノテータが関与するクラウドソーシングフレームワークを提案する。集約されたクラウドアノテーションが専門家と比較してF1スコア0.67以上を達成することを示し、解けない意見の相違が文、フレーム、またはタスク定義における本質的なあいまいさを反映していることを示唆する。これは、機械学習の学習に単一の正解ラベルを仮定するという前提に疑問を呈する。

ABSTRACT

FrameNet is a computational linguistics resource composed of semantic frames, high-level concepts that represent the meanings of words. In this paper, we present an approach to gather frame disambiguation annotations in sentences using a crowdsourcing approach with multiple workers per sentence to capture inter-annotator disagreement. We perform an experiment over a set of 433 sentences annotated with frames from the FrameNet corpus, and show that the aggregated crowd annotations achieve an F1 score greater than 0.67 as compared to expert linguists. We highlight cases where the crowd annotation was correct even though the expert is in disagreement, arguing for the need to have multiple annotators per sentence. Most importantly, we examine cases in which crowd workers could not agree, and demonstrate that these cases exhibit ambiguity, either in the sentence, frame, or the task itself, and argue that collapsing such cases to a single, discrete truth value (i.e. correct or incorrect) is inappropriate, creating arbitrary targets for machine learning.

研究の動機と目的

  • FrameNetの単一の専門家によるラベリングの限界を是正し、言語の多様性とあいまいさを捉えること。
  • クラウドソーシングによるフレーム意味あいまいさのタスクで、アノテータ間の意見の相違が誤りではなく、本質的なあいまいさを反映しているかどうかを調査すること。
  • 意見の相違に基づいて、フレーム-文の一致度(FSS)、文の品質(SQS)、フレームの品質(FQS)を定量化するための指標を開発すること。
  • あいまいなケースを単一の離散的ラベルに統合する慣習に反対し、機械学習の学習ターゲットに恣意的な値をもたらす問題を指摘すること。
  • クラウドワーカーからの複数の解釈を保持することで、より頑健であいまいさに配慮したデータセットを構築すること。

提案手法

  • 15名のワーカーが1文に対して関与するように、複数のアノテーションを収集するため、CrowdTruthフレームワークを採用した。
  • 3つの新しい指標を定義・計算した:フレーム-文一致度(FSS)、文の品質スコア(SQS)、フレームの品質スコア(FQS)、これらは合意度とあいまいさの評価に用いた。
  • 各ワーカーに対して二値ラベリング(フレームが適用されるか否か)を実施し、意見の相違をノイズではなく、あいまいさの代理指標として用いた。
  • コンSENSUSベースの手法を用いてクラウドアノテーションを集約し、1文あたり1つのラベルを生成し、専門家がアノテートしたゴールドスタンダードと比較した。
  • 意見の相違が著しいケースについて定性的分析を実施し、タスクの誤解、文脈の欠落、および本質的な意味的あいまいさの違いを区別した。
  • 先行研究のクラウドソーシングによるフレーム意味あいまいさの研究を再現・拡張し、意見の相違を情報として明示的にモデル化することで、より優れたアプローチを実現した。

実験結果

リサーチクエスチョン

  • RQ1複数のアノテータによるクラウドソーシングは、専門家レベルのパフォーマンスに匹敵するフレーム意味あいまいさのアノテーションを信頼性高く捉えることができるか?
  • RQ2アノテータ間の意見の相違は、主に誤りではなく、文やフレームにおける本質的なあいまいさを反映しているのか、その程度はどの程度か?
  • RQ3フレーム定義と文の文脈は、フレーム意味あいまいさタスクにおけるあいまいさにどのように寄与しているか?
  • RQ4あいまいなケースを単一の離散的ラベルに統合することは、機械学習にとって問題を引き起こすのか。もしそうなら、その理由は何か?
  • RQ5意見の相違指標(FSS、SQS、FQS)は、フレーム意味論における文の品質とフレームの品質を信頼性を持って示す指標として機能するのか?

主な発見

  • 集約されたクラウドアノテーションは、専門家言語学者と比較してF1スコアが0.67を超えた。これは、最先端の手法と同等の高いパフォーマンスを示している。
  • 専門家が意見を異にした場合でも、クラウドのコンセンサスが正しかったケースが存在し、あいまいな文脈では集約されたアノテーションが個々の専門家の判断を上回ることを示した。
  • アノテータ間の意見の相違は、主にワーカーの誤解ではなく、文、フレーム定義、またはタスク構造におけるあいまいさと強く関連していた。
  • FQS(フレームの品質スコア)が低いフレーム(例:「支援」「目的」「変化を経験する」など、抽象的または重複するフレーム)では、意見の相違が顕著に高まり、より高いあいまいさを示した。
  • 「殺害」や「食事」のようなフレームはFQSが高く、あいまいさが少なかったため、フレームの具象性とあいまいさの低減の間には相関関係があると示唆された。
  • 本研究の結果は、あいまいなケースに単一の真実値を強制することは、機械学習のモデルの頑健性と公平性を損なう恣意的なターゲットを生み出すと主張する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。