Skip to main content
QUICK REVIEW

[論文レビュー] Team Phoenix at WASSA 2021: Emotion Analysis on News Stories with Pre-Trained Language Models

Yash Butala, Kanishk Singh|arXiv (Cornell University)|Mar 10, 2021
Topic Modeling参考文献 30被引用数 7
ひとこと要約

この論文は、WASSA 2021 共同タスクにおけるニュースストーリーの感情分析のため、事前学習済み言語モデルを用いたマルチタスク学習アプローチを提示している。トラック1(共感と苦痛の予測)では、パラメータ共有と正規化された人種的特徴を伴う文埋め込みの回帰を用い、ピアソン相関係数0.417を達成した。トラック2(多次元感情予測)では、微調整されたT5モデルによる条件付き生成が分類手法を上回ることを示し、マクロ-F1スコア0.502を達成し、リーダーボードで2位を獲得した。

ABSTRACT

Emotion is fundamental to humanity. The ability to perceive, understand and respond to social interactions in a human-like manner is one of the most desired capabilities in artificial agents, particularly in social-media bots. Over the past few years, computational understanding and detection of emotional aspects in language have been vital in advancing human-computer interaction. The WASSA Shared Task 2021 released a dataset of news-stories across two tracks, Track-1 for Empathy and Distress Prediction and Track-2 for Multi-Dimension Emotion prediction at the essay-level. We describe our system entry for the WASSA 2021 Shared Task (for both Track-1 and Track-2), where we leveraged the information from Pre-trained language models for Track-specific Tasks. Our proposed models achieved an Average Pearson Score of 0.417 and a Macro-F1 Score of 0.502 in Track 1 and Track 2, respectively. In the Shared Task leaderboard, we secured 4th rank in Track 1 and 2nd rank in Track 2.

研究の動機と目的

  • パラメータ共有を用いた事前学習済み言語モデルを用いて、ニュースストーリーにおける共感と苦痛の予測を向上させること。
  • 多次元感情予測において、条件付き生成モデルが分類モデルを上回るかを調査すること。
  • 感情分析の小規模データセットにおけるタスク固有の段階的微調整の有効性を評価すること。
  • 人種的・性格的特徴を統合することで、感情予測性能が向上するかを検討すること。

提案手法

  • トラック1では、共感と苦痛の予測ヘッド間にパラメータ共有を施したマルチタスク学習を採用し、文埋め込みと正規化された人種的特徴を活用した。
  • トラック1の最終予測は、文埋め込みと人種的特徴埋め込みを連結したものを用いたMLPによる回帰で実行された。
  • トラック2では、微調整されたT5およびPegasusモデルを用いて、感情予測を条件付き生成タスクとして定式化した。
  • 著者らは、タスク固有の感情分類データセットを用いて事前学習済みT5-baseモデルの段階的微調整を実施し、ベースモデルより性能が向上した。
  • システムは、Hugging Faceの事前学習済みモデル(T5-baseおよびBERT-base)を用い、トランスファー学習とアブレーションスタディを実施してアーキテクチャを比較した。
  • 性能評価は、開発セットおよびホールドアウトテストセットを用い、トラック1ではピアソン相関、トラック2ではマクロ-F1で実施した。

実験結果

リサーチクエスチョン

  • RQ1共感と苦痛の予測の間でパラメータ共有を行うことで、ニュースストーリーの感情分析性能が向上するか?
  • RQ2小規模データセット上での多次元感情予測において、条件付き生成モデルが従来の分類モデルを上回るか?
  • RQ3事前学習済み言語モデルのタスク固有の段階的微調整が、感情予測タスクの性能向上に寄与するか?
  • RQ4正規化された人種的および性格的特徴は、感情予測モデルの性能向上にどの程度有効か?

主な発見

  • 最終的なトラック1の提出は、ホールドアウトテストセットにおいて平均ピアソン相関係数0.417を達成し、共同タスクのリーダーボードで4位を獲得した。
  • 微調整されたT5-baseモデルを用いたトラック2のシステムは、開発セットでマクロ-F1スコア0.572を達成し、BERT-base(0.38)およびALBERT-base-v2(0.4739)を上回った。
  • 最終的なトラック2の提出は、テストセットでマクロ-F1スコア0.502を達成し、共同タスクのリーダーボードで2位を獲得した。
  • 条件付き生成モデル(例:T5およびPegasus)は、文脈的埋め込みに基づく分類モデル(例:BERTおよびALBERT)を上回り、トラック2の感情予測で優れた性能を示した。
  • T5モデルのタスク固有の段階的微調整は顕著な性能向上をもたらし、微調整済みバージョンは0.572のマクロ-F1を達成したのに対し、ベースT5モデルは0.5259であった。
  • アブレーションスタディの結果、MLPベースの回帰ヘッドがバリデーションセットで最も優れた性能を示したが、XGBoost や AdaBoost などの他のモデルも強力な性能を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。