Skip to main content
QUICK REVIEW

[論文レビュー] An Experimental Study of The Effects of Position Bias on Emotion CauseExtraction

Jiayuan Ding, Mayank Kejriwal|arXiv (Cornell University)|Jul 16, 2020
Color perception and design参考文献 24被引用数 10
ひとこと要約

本論文は、Sina-newsベースの感情原因抽出(ECE)ベンチマークにおける位置バイアス——原因が感情節の直前に頻出する——が、単純なランダム選択法がF-measure 54.43%を達成可能にし、深層学習モデルと同等の性能を示すことを示している。データセットのバイアスを除去するためのバランス調整を行った後、すべてのモデル、包括して最先端のネットワークでさえも性能が20%以上低下した。これは、従来の高い正確性が意味的理解に基づくものではなく、データセットバイアスに起因していたことを証明している。

ABSTRACT

Emotion Cause Extraction (ECE) aims to identify emotion causes from a document after annotating the emotion keywords. Some baselines have been proposed to address this problem, such as rule-based, commonsense based and machine learning methods. We show, however, that a simple random selection approach toward ECE that does not require observing the text achieves similar performance compared to the baselines. We utilized only position information relative to the emotion cause to accomplish this goal. Since position information alone without observing the text resulted in higher F-measure, we therefore uncovered a bias in the ECE single genre Sina-news benchmark. Further analysis showed that an imbalance of emotional cause location exists in the benchmark, with a majority of cause clauses immediately preceding the central emotion clause. We examine the bias from a linguistic perspective, and show that high accuracy rate of current state-of-art deep learning models that utilize location information is only evident in datasets that contain such position biases. The accuracy drastically reduced when a dataset with balanced location distribution is introduced. We therefore conclude that it is the innate bias in this benchmark that caused high accuracy rate of these deep learning models in ECE. We hope that the case study in this paper presents both a cautionary lesson, as well as a template for further studies, in interpreting the superior fit of deep learning models without checking for bias.

研究の動機と目的

  • ECEモデルの高い性能が深層的意味理解によるものか、データセットバイアスに起因するものかを調査すること。
  • 広く使われているSina-newsベンチマークにおける位置バイアスを特定し、定量的に評価すること。
  • テキスト解析を行わず、文の位置に基づく単純な選択手法が、テキスト内容を考慮せずに競争力のあるF-measureを達成できることを実証すること。
  • 感情原因の出現位置を均等に分布させるように調整されたバイアス除去済みベンチマークを提案し、ECEモデルの公平な評価を可能にすること。
  • ECEタスクにおける高いモデル正確性の解釈を再考し、モデルの洗練度に起因する性能ではなく、データセットバイアスの影響を評価する必要があることを訴えること。

提案手法

  • テキスト内容を観察せず、相対的な文の位置に基づいて感情原因ラベルを割り当てるランダム選択ベースラインを評価した。
  • 元のSina-newsベンチマークを分析し、感情原因が感情節の直前に出現する頻度(位置-1)が著しく高いことを定量的に評価した。
  • 全位置カテゴリ(-12から+12の文)における感情原因の出現確率を均等にするように再サンプリングすることで、バランスの取れたベンチマークを構築した。
  • 3つの最先端の深層学習モデル(PAE, PAEDGL, RTHN)を、元のベンチマークおよびバイアス除去済みベンチマークの両方で再評価し、バイアス除去による性能低下を測定した。
  • 統計的分析を用いて、バイアス除去前後におけるモデル性能の差をF1スコアの変化に焦点を当てて比較した。
  • 言語的分析を通じて、バイアスの原因を特定し、Sina-newsの均質なライティングスタイルとジャンルの一貫性と関連づけた。

実験結果

リサーチクエスチョン

  • RQ1Sina-newsベンチマークにおける位置バイアスが、ECEモデルの高い性能にどの程度寄与しているか。
  • RQ2テキスト内容を一切使用せず、文の位置に基づくランダム選択法が、競争力のあるF-measureを達成できるか。
  • RQ3文の位置分布を均等化することでデータセットをバイアス除去した場合、最先端の深層学習モデルの性能にどのような影響が生じるか。
  • RQ4ECEタスクにおける深層学習モデルの高い正確性が、真の意味理解を反映しているのではなく、データセットバイアスの利用に起因する理由は何か。
  • RQ5Sina-newsコーパスのどの言語的・構造的特徴が、ECEにおける位置バイアスの発生に寄与しているか。

主な発見

  • テキスト解析を行わず、文の位置に基づくランダム選択法が、元のSina-newsベンチマークでF1スコア54.43%を達成し、複雑な深層学習モデルの性能と同等またはそれを上回った。
  • 元のベンチマークには強い位置バイアスが存在し、感情原因の54.45%が感情節の直前(位置-1)に出現していた。
  • 位置分布をバランスさせるためにデータセットをバイアス除去した後、ランダムベースラインのF1スコアは24.04%に低下した。これは、元のベンチマークにおける性能の主な要因が位置そのものであったことを示している。
  • テストした3つの深層学習モデル(PAE, PAEDGL, RTHN)は、すべてバイアス除去後のベンチマークで20%以上の性能低下を示し、F1スコアは41%未満に低下した。
  • RTHNのような最先端モデルの性能は、元のベンチマークでF1スコア54.45%を記録したが、バランス化されたベンチマークでは54.45%に低下した。これは、その高い正確性が意味的推論ではなく、位置バイアスの利用に起因していたことを証明している。
  • Sina-newsの言語的均質性とジャンル特有のスタイルが、位置バイアスの発生に顕著に寄与しており、結果としてベンチマークは一般化性が低く、挑戦的でないものとなった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。