Skip to main content
QUICK REVIEW

[論文レビュー] WASSA@IITK at WASSA 2021: Multi-task Learning and Transformer Finetuning for Emotion Classification and Empathy Prediction

Jay Mundra, Rohan Gupta|arXiv (Cornell University)|Apr 20, 2021
Sentiment Analysis and Opinion Mining参考文献 18被引用数 8
ひとこと要約

本論文は、WASSA 2021 共同タスクにおける感情分類および共感予測のため、ELECTRA および RoBERTa を用いたマルチタスク学習とファインチューニング手法を提示する。トランスファーラーニング、GoEmotions を用いたデータ拡張、アンサンブル手法を活用することで、感情分類ではマクロ F1 スコア 0.5528(1位)、共感予測ではピアソン相関係数 0.533(3位)を達成した。

ABSTRACT

This paper describes our contribution to the WASSA 2021 shared task on Empathy Prediction and Emotion Classification. The broad goal of this task was to model an empathy score, a distress score and the overall level of emotion of an essay written in response to a newspaper article associated with harm to someone. We have used the ELECTRA model abundantly and also advanced deep learning approaches like multi-task learning. Additionally, we also leveraged standard machine learning techniques like ensembling. Our system achieves a Pearson Correlation Coefficient of 0.533 on sub-task I and a macro F1 score of 0.5528 on sub-task II. We ranked 1st in Emotion Classification sub-task and 3rd in Empathy Prediction sub-task

研究の動機と目的

  • 有害関連のニュース記事に対する反応エッセイにおける共感と感情のモデリングの課題に対処すること。
  • 事前学習されたトランスフォーマー モデルを用いて、低リソースな感情分類および共感予測タスクのパフォーマンスを向上させること。
  • マルチタスク学習とデータ拡張が、モデルの一般化性能を向上させ、バイアスを低減する有効性を検証すること。
  • ディープラーニングを用いてエッセイレベルでの共感スコアおよび苦痛スコアを予測する堅牢なシステムを開発すること。
  • モデル初期化の感度とアンサンブル戦略が、パフォーマンスの安定性と正確性に与える影響を評価すること。

提案手法

  • 感情分類(感情)タスクと回帰(共感/苦痛)タスクの両方に対して、1つの全結合層を介して、ELECTRA-large および RoBERTa-large モデルをエンドツーエンドでファインチューニングする。
  • ELECTRA エンコーダーを共有し、共感と苦痛予測のための別々の全結合ヘッドを用いることでマルチタスク学習を実装し、平均二乗誤差(MSE)損失を用いて同時に最適化する。
  • 感情分類タスクにおけるクラス分布のバランスを改善するため、GoEmotions データセットを用いたデータ拡張を実施し、特に低頻度クラスの性能向上を図る。
  • 複数のトレーニング済みモデルの予測を単純平均することでモデルアンサンブルを実装し、一般化性能の向上と分散の低減を図る。
  • AdamW オプティマイザーを用い、学習率 1e-5、重み減衰、1台の Tesla V100 GPU を使用して Google Colab 上でバッチサイズ 8 または 16 でモデルを訓練する。
  • 初期化の感度に起因するパフォーマンスのばらつきを軽減するため、複数のランダム シードを用いてモデルを複数回訓練する。

実験結果

リサーチクエスチョン

  • RQ1共有トランスフォーマー エンコーダーを用いたマルチタスク学習は、共感予測および感情分類タスクの両方のパフォーマンスを向上させることができるか?
  • RQ2GoEmotions データセットを用いたデータ拡張は、低リソースな感情分類におけるモデルの一般化性能とバイアス低減にどの程度有効か?
  • RQ3モデルアンサンブルは、ファインチューニングされたトランスフォーマー モデルにおける分散をどの程度低減し、パフォーマンスの安定性を向上させるか?
  • RQ4ファインチューニングされた ELECTRA および RoBERTa モデルは重み初期化にどの程度感度を示すか?また、アンサンブル戦略によってその感度は軽減可能か?
  • RQ5ELECTRA や RoBERTa のような事前学習モデルを用いることで、共感および感情予測のような低リソースな感情計算タスクにどのような影響を与えるか?

主な発見

  • ELECTRA と RoBERTa モデルのアンサンブルは、感情分類のテストセットでマクロ F1 スコア 0.5528 を達成し、共通タスクで1位となった。
  • 最終システムは、共感予測サブタスクでピアソン相関係数 0.533 を達成し、全提出物の中で3位となった。
  • GoEmotions を用いたデータ拡張は、モデルパフォーマンスの向上に顕著に寄与し、特に怒りの過剰予測を低減し、低頻度クラスの性能を向上させた。
  • モデルパフォーマンスは初期化に極めて敏感であり、異なるランダム シードでの検証スコアに顕著なばらつきが見られた。これにより、アンサンブル手法の必要性が強調された。
  • 混同行列では、恐怖に対する強い性能が確認され、データ拡張後は特に、喜びが怒りと誤分類されるケースが減少し、クラス間のバランスが改善された。
  • 共感および苦痛予測の各タスクに対して2つのモデルをアンサンブルすることで、個々のモデルに比べて一般化性能が向上し、相関係数および F1 スコアが向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。