Skip to main content
QUICK REVIEW

[論文レビュー] Accenture at CheckThat! 2021: Interesting claim identification and ranking with contextually sensitive lexical training data augmentation

Evan R. Williams, Paul Rodrigues|arXiv (Cornell University)|Jul 12, 2021
Topic Modeling被引用数 4
ひとこと要約

本論文は、多言語のソーシャルメディアにおける事実確認のための主張同定およびランク付けを改善するために、BERTおよびRoBERTaを用いた文脈に敏感な語彙的データ拡張手法を提示する。文脈的埋め込みに基づいてキーワードを意味的に適切な同義語に置き換えることで、このアプローチは性能を顕著に向上させた。特に、CLEF 2021 CheckThat! Labのアラビア語トラックで最高のmAP(0.658)を達成し、訓練データ量へのモデル感受性と効果的なデータ合成のおかげで、他の言語を上回った。

ABSTRACT

This paper discusses the approach used by the Accenture Team for CLEF2021 CheckThat! Lab, Task 1, to identify whether a claim made in social media would be interesting to a wide audience and should be fact-checked. Twitter training and test data were provided in English, Arabic, Spanish, Turkish, and Bulgarian. Claims were to be classified (check-worthy/not check-worthy) and ranked in priority order for the fact-checker. Our method used deep neural network transformer models with contextually sensitive lexical augmentation applied on the supplied training datasets to create additional training samples. This augmentation approach improved the performance for all languages. Overall, our architecture and data augmentation pipeline produced the best submitted system for Arabic, and performance scales according to the quantity of provided training data for English, Spanish, Turkish, and Bulgarian. This paper investigates the deep neural network architectures for each language as well as the provided data to examine why the approach worked so effectively for Arabic, and discusses additional data augmentation measures that should could be useful to this problem.

研究の動機と目的

  • 自動的事実確認のため、多言語のソーシャルメディアにおけるチェック対象となる主張の同定およびランク付けを改善すること。
  • 特にアラビア語、ブルガリア語、ターキッシュ語、スペイン語などの低リソース言語において顕著な訓練データの不均衡問題に対処すること。
  • 外部データソースに依存せずに、文脈に裏付けられたデータ拡張によってモデルの一般化性能と性能を向上させること。
  • 文脈的埋め込みを用いた語彙的拡張が、低リソースNLP設定においてランダムまたは非文脈的拡張を上回る可能性があるかどうかを検証すること。
  • 複数の言語にわたる性能向上と計算コストのバランスを取るために、最適な拡張強度(確率)を特定すること。

提案手法

  • 本手法は、訓練データ内のチェック対象となる主張の語に、BERTおよびRoBERTaモデルを用いて文脈的に適切な同義語を置き換える。
  • 各主張について、トークンレベルの埋め込み確率を計算し、文脈的分布下で最も高い尤度を持つ置換を特定する。
  • ハイパーパrameter p は置換の確率を制御する。性能と計算コストのバランスを取るために、アブレーションスタディの結果、p = 0.1 が選択された。
  • 拡張されたサンプルは元の訓練データに同じ「チェック対象」ラベルを付けて追加され、ポジティブクラスのサイズが拡大された。
  • 最終的なモデルアーキテクチャには、微調整時の過学習を防ぐために、分類ヘッドの前段に平均プーリング層とドロップアウト層が含まれている。
  • ランク付けはモデルのソフトマックス出力を用い、ポジティブクラスとネガティブクラスの確率差を基に主張を優先順位付けした。

実験結果

リサーチクエスチョン

  • RQ1文脈に敏感な語彙的データ拡張は、事実確認タスクにおける複数の低リソース言語において、主張検出性能を向上させるか?
  • RQ2異なる言語において、データ拡張強度(p)の違いがモデル性能に与える影響は何か?
  • RQ3同じ拡張処理が適用されているにもかかわらず、なぜ本手法はアラビア語で優れた結果を達成したのか?
  • RQ4文脈的埋め込みに基づく拡張は、低リソースNLPシナリオにおいて、ランダムまたは非文脈的拡張を上回るか?
  • RQ5訓練データの量と分布が、データ拡張とどのように相互作用し、モデル性能に影響を与えるか?

主な発見

  • 文脈に敏感な語彙的拡張手法は、開発セットにおいて全5言語(アラビア語、ブルガリア語、英語、スペイン語、ターキッシュ語)の「チェック対象」クラスのF1スコアを向上させた。
  • 本システムは、アラビア語トラックで最高の平均平均精度(mAP)0.658を達成し、コンペティション全体で他すべての提出物を上回った。
  • 訓練データ量に比例して性能が向上し、より多くの訓練サンプルを受け取った言語(例:ターキッシュ語とアラビア語、各3,095サンプル)で高いmAP値が観察された。
  • ブルガリア語ではmAP 0.497、スペイン語ではmAP 0.491を記録し、中リソース言語においても強力な性能を示した。
  • 英語ではmAP 0.101に低下したため、ベースラインデータがすでに比較的豊富な場合、本手法の有効性が低い可能性があると示唆された。
  • アブレーションスタディにより、p = 0.1 が性能向上と計算コストの両立において最良のトレードオフをもたらすことが確認された。より高い値では収益が逓減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。