Skip to main content
QUICK REVIEW

[論文レビュー] Overview of the CLEF-2018 CheckThat! Lab on Automatic Identification and Verification of Political Claims. Task 1: Check-Worthiness

Pepa Atanasova, Alberto Barrón‐Cedeño|arXiv (Cornell University)|Aug 8, 2018
Natural Language Processing Techniques被引用数 16
ひとこと要約

本論文は、CLeF-2018 CheckThat! ラボのタスク1を提示しており、fact-checkingの優先度を自動的に特定・順位付けする政治的主張の識別に焦点を当てている。最良のシステムは深層学習モデル、分布的表現、句構造特徴を用い、英語データセットでは平均平均精度(MAP)が0.18、アラビア語データセットでは0.15を達成した。すべてのデータとツールは、今後のチェック適合性推定に関する研究を促進するために公開された。

ABSTRACT

We present an overview of the CLEF-2018 CheckThat! Lab on Automatic Identification and Verification of Political Claims, with focus on Task 1: Check-Worthiness. The task asks to predict which claims in a political debate should be prioritized for fact-checking. In particular, given a debate or a political speech, the goal was to produce a ranked list of its sentences based on their worthiness for fact checking. We offered the task in both English and Arabic, based on debates from the 2016 US Presidential Campaign, as well as on some speeches during and after the campaign. A total of 30 teams registered to participate in the Lab and seven teams actually submitted systems for Task~1. The most successful approaches used by the participants relied on recurrent and multi-layer neural networks, as well as on combinations of distributional representations, on matchings claims' vocabulary against lexicons, and on measures of syntactic dependency. The best systems achieved mean average precision of 0.18 and 0.15 on the English and on the Arabic test datasets, respectively. This leaves large room for further improvement, and thus we release all datasets and the scoring scripts, which should enable further research in check-worthiness estimation.

研究の動機と目的

  • 議論や演説における政治的主張の中で、fact-checkingの優先度が最も高いものを自動的に特定するシステムの開発を目的とする。
  • 手動でのfact-checkingが限られている高頻度で変化する情報環境において、主張の優先順位を付けるという課題に対処すること。
  • 2016年米国大統領選挙の英語およびアラビア語の政治的討論から得たデータを用いて、システムの評価を行うこと。
  • 今後の自動チェック適合性推定に関する研究を支援するため、アノテート済みデータセットと評価スクリプトを公開すること。
  • ニューラルネットワーク、語彙マッチング、句構造特徴の有効性が、fact-checkingの優先度予測にどのように寄与するかを調査すること。

提案手法

  • タスクでは、参加者が政治的討論や演説の文をチェック適合性の観点から順位付けするよう求められ、出力として順序付きリストを提供した。
  • システムの評価には平均平均精度(MAP)が用いられ、factcheck.orgのゴールドスタンダードアノテーションが基準として用いられた。
  • 参加者は再帰的ニューラルネットワーク(RNNs)、多層ニューラルネットワーク、および分布的単語表現と句構造依存解析を組み合わせたハイブリッドモデルを採用した。
  • 語彙マッチング技術を用いて、主張の語彙をfact-checking関連の語彙リストと一致させた。
  • アンサンブル手法により、複数のシステムの予測スコアを正規化した上で合算し、個々のシステムよりも性能を向上させた。
  • アブレーションスタディを実施し、個々のシステムがアンサンブル性能に果たす寄与度を評価した。

実験結果

リサーチクエスチョン

  • RQ1どの特徴とアーキテクチャが、fact-checkingに最も適した政治的主張を予測するのに最適か?
  • RQ2チェック適合性推定において、英語とアラビア語の政治的テキストの間で性能にどのような差が生じるか?
  • RQ3この順位付けタスクにおいて、アンサンブル手法は個々のシステムよりも性能をどの程度向上させられるか?
  • RQ4分布的表現と句構造特徴は、チェック適合性のある主張を特定するために、それぞれどのように寄与するか?
  • RQ5fact-checking語彙リストとの語彙マッチングは、高優先度の主張の検出をどの程度向上させられるか?

主な発見

  • 最良のシステムは、英語テストセットで平均平均精度(MAP)0.18、アラビア語テストセットで0.15を達成した。
  • 複数のシステムの正規化スコアを合算するアンサンブル手法により、最良の個別システムと比較して、英語で3.4%、アラビア語で3.6%のMAP向上が達成された。
  • 『blue』のような特定のシステムをアンサンブルから除外すると性能が向上することがあり、これは非一様な寄与度と、モデルレベルの統合の可能性を示唆している。
  • アブレーション実験の結果、大多数の個別システムがアンサンブルに正の寄与をしていたが、一部は負の影響や無視できる影響を及えた。
  • 現在の性能は依然として低いため、さらなる改善の余地が大きく、より良い特徴工学とモデルアーキテクチャの開発が求められることが示唆された。
  • すべてのデータセットと評価スクリプトが、今後の自動チェック適合性推定に関する研究を支援するために公開された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。