Skip to main content
QUICK REVIEW

[論文レビュー] Applying a Pre-trained Language Model to Spanish Twitter Humor Prediction

Bobak Farzin, Piotr Czapla|arXiv (Cornell University)|Jul 6, 2019
Humor Studies and Applications参考文献 11被引用数 5
ひとこと要約

本論文は、大規模に自前収集したスペイン語ツイッターコーパス(475K件のツイート)とラベルスムージングを活用して、スペイン語ツイッターのユーモア検出および回帰のためのファインチューニング済み事前学習言語モデルを提案する。この手法は、ファスト・エイ、およびランダムシード最適化によるモデル初期化を用いたトランスファーラーニングにより、強力なNBSVMベースラインを上回り、ユーモア検出で3位(F1: 0.8099)、回帰で2位を達成した。

ABSTRACT

Our entry into the HAHA 2019 Challenge placed $3^{rd}$ in the classification task and $2^{nd}$ in the regression task. We describe our system and innovations, as well as comparing our results to a Naive Bayes baseline. A large Twitter based corpus allowed us to train a language model from scratch focused on Spanish and transfer that knowledge to our competition model. To overcome the inherent errors in some labels we reduce our class confidence with label smoothing in the loss function. All the code for our project is included in a GitHub repository for easy reference and to enable replication by others.

研究の動機と目的

  • 事前学習言語モデルを用いたトランスファーラーニングにより、スペイン語ツイッターにおけるユーモア検出と面白さスコアリングの性能を向上させること。
  • 損失関数におけるラベルスムージングを用いて、ラベルノイズや予測の過信を軽減すること。
  • 20回の試行で得られる最良の初期化を選択することで、ランダムシードをハイパーパrameterとして扱い、モデルの汎化性能を向上させること。
  • ドメイン特化された大規模なスペイン語ツイッターコーパスを用いて、堅牢で再現性のあるシステムを構築すること。
  • 両方のタスク(ユーモア分類および回帰)において、標準のNBSVMベースラインを上回ること。

提案手法

  • tweepyを用いて収集した475,143件のツイートから成るスペイン語ツイッターコーパスを用いて、言語モデルを事前学習した。リツイートを除外することで、重複を低減した。
  • 繰り返し文字の処理、すべて大文字の単語、句読点の空白調整、改行正規化などのテキストクリーニング関数を順次適用した。
  • 30,000語彙サイズのサブワード単位に分けるために、SentencePieceとバイトペアエンコーディング(BPE)を用いたトークン化を実施した。
  • ULMFiTスタイルのトランスファーラーニングを用い、最終層をソフトマックス(分類)または線形(回帰)ヘッドに置き換えて、言語モデルをファインチューニングした。
  • 予測の過信を回避し、正則化を図るために、損失関数にラベルスムージングを導入した。これにより、段階的フリーズ解除を必要とせず、フルトレーニングが可能になった。
  • 20回の初期化から最良のランダムシードを選択し、検証データに対して5分割交差検証を実施することで、モデル性能を最適化した。

実験結果

リサーチクエスチョン

  • RQ1標準の事前学習モデルと比較して、自前収集の大型スペイン語ツイッターコーパスは、ユーモア検出性能の向上に寄与するか?
  • RQ2トランスファーラーニングにおける段階的フリーズ解除と比較して、損失関数にラベルスムージングを適用することで、より良い汎化性能と高速収束が達成されるか?
  • RQ3スペイン語ユーモア分類のような低リソースNLPタスクにおいて、ランダムシード初期化はモデル性能にどのように影響するか?
  • RQ4ドメイン特化された言語モデルを用いたトランスファーラーニングは、強力なNBSVMベースラインをどれほど上回るか?
  • RQ5事前学習言語モデルを用いたエンドツーエンドトレーニングは、特徴工学なしにスペイン語ユーモア検出および回帰で最先端の結果を達成できるか?

主な発見

  • モデルはテストセットにおいてF1スコア0.8099を達成し、NBSVMベースライン(F1: 0.7548)を上回り、ユーモア検出タスクで3位を獲得した。
  • 最良のモデルは検証セットで5分割交差検証F1スコア0.8254を達成し、優れた汎化性能を示した。
  • ラベルスムージングのおかげで、段階的フリーズ解除を必要とせず、フルトレーニングが可能になり、トレーニングの複雑さを低減しながらも性能を維持した。
  • 20回の試行から得られた最良のランダムシードは、最初のシードよりもF1スコアを0.0016向上させ、初期化の重要性を示した。
  • 回帰タスクにおいても、F1(0.8099 vs. 0.7548)およびRMSEの両面でNBSVMベースラインを上回り、2位を獲得した。
  • 16倍大きなドメイン特化型スペイン語ツイッターコーパスの使用により、スラング、略語、絵文字といったユーモアに関連する表現を言語モデルがより良く捉える能力が向上した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。