[論文レビュー] Emotion Ratings: How Intensity, Annotation Confidence and Agreements are Entangled
本研究は、テキスト感情分類における感情の強度、アノテーションの自信、およびアノテータ間的一致性の関係を調査する。COCAのサブセットを用いて、レーティング担当者が感情の有無、強度(1〜3)、および自己評価された自信(1〜3)をラベル付けした。その結果、自信は感情の強度および不一致の両者と強く相関しており、自信が系統的なアノテーションの不一致を示す診断的指標である可能性があることが示された。これは、実際の強度よりも感情の顕著さの認識に起因する可能性がある。
When humans judge the affective content of texts, they also implicitly assess the correctness of such judgment, that is, their confidence. We hypothesize that people's (in)confidence that they performed well in an annotation task leads to (dis)agreements among each other. If this is true, confidence may serve as a diagnostic tool for systematic differences in annotations. To probe our assumption, we conduct a study on a subset of the Corpus of Contemporary American English, in which we ask raters to distinguish neutral sentences from emotion-bearing ones, while scoring the confidence of their answers. Confidence turns out to approximate inter-annotator disagreements. Further, we find that confidence is correlated to emotion intensity: perceiving stronger affect in text prompts annotators to more certain classification performances. This insight is relevant for modelling studies of intensity, as it opens the question wether automatic regressors or classifiers actually predict intensity, or rather human's self-perceived confidence.
研究の動機と目的
- 自己評価されたアノテーションの自信が、感情分類におけるアノテータ間の不一致と相関しているかどうかを検証すること。
- 感情の強度の認識が、アノテータの判断に対する自信に影響を与えるかどうかを調査すること。
- 自信と強度が共同して、感情アノテーションにおける系統的な不一致を説明できるかどうかを評価すること。
- 自信が、信頼性の低いまたは一貫性のないアノテーションを特定するための診断的ツールとして機能するかどうかを評価すること。
- これらの関係が、NLPにおける感情強度のモデリングに与えるインパクトを検討すること。
提案手法
- レーティング担当者は、コロナス・オブ・コンTEMPORARY・アメリカン・イングリッシュ(COCA)の文を、感情の有無(感情的 vs. 中立)、強度(1〜3のリッカート尺度)、および自己評価された自信(1〜3のリッカート尺度)の3つの次元で評価した。
- アノテータには、意図された感情や認知的解釈ではなく、個人の認識に基づいて感情を判断するように指示された。
- データ収集は、計算感情分析経験を持つ3名の訓練済み女性アノテータが参加した、制御されたラボ環境で実施された。
- 強度と自信の両方にリッカート尺度を用い、相関関係や一致パターンの定量的分析を可能にした。
- 完全一致ケース(感情、自信、強度)は、言語的およびジャンルベースのパターンを同定するために手動で分析された。
- 統計的分析により、自信、強度、およびアノテータ間の不一致の関係が検討され、複数アノテータ間の一貫性も評価された。
実験結果
リサーチクエスチョン
- RQ1RQ1: 感情の有無に関するアノテータ間の不一致は、アノテータの自己評価された自信に関連しているか?
- RQ2RQ2: 感情の強度の判断と自己評価された自信は、相互に絡み合っているか?
- RQ3RQ3: 自信と強度が共同して、系統的なアノテーションの不一致を説明できるか?
- RQ4RQ4: 高い自信が強い強度と同時に現れるか、それ以外の反例は存在するか?
主な発見
- 自信はアノテータ間の不一致と強く相関している:低い自信は、高い不一致率と関連している。
- 感情の強度と自己評価された自信は有意に相関している—強い感情の認識は、ラベル付けに対する高い自信をもたらす。
- 高強度(3)と低自信(1または2)の組み合わせは一切確認されなかった。これは、高強度が信頼性の高い自信の上昇を引き起こすことを示している。
- 感情、自信、強度の3つすべてで完全一致が生じたのは、個人経験や直接的な感情状態を表す文で最も頻繁に観察された。
- 中立ラベルはニュースや事実中心のジャンルでより頻出していた一方、感情ラベルは小説、ブログ、話言語のテキストでより一般的であった。
- 本研究では、自信が実際の強度の妥当な代理指標ではないことが判明した。一部の高強度ケースで低自信が付与されており、逆に高強度で高自信のケースも存在するなど、複雑な関係が示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。