[論文レビュー] Overview of the CLEF-2019 Checkthat! LAB: Automatic identification and verification of claims. Task 2: Evidence and factuality
本論文は、CLEF-2019 CheckThat! ラボの第2版を提示し、英語の主張のチェック価値推定とアラビア語の主張の根拠に基づく事実性検証の2つの多言語タスクを導入する。研究ではニューラルネットワークと教師あり分類器を用いてシステムを評価し、主張の優先順位付けおよび事実性予測において最先端の結果を達成した。公開されたデータセットと評価ツールにより、自動的事実確認研究の発展を促進する。
We present an overview of the second edition of the CheckThat! Lab at CLEF 2019. The lab featured two tasks in two different languages: English and Arabic. Task 1 (English) challenged the participating systems to predict which claims in a political debate or speech should be prioritized for fact-checking. Task 2 (Arabic) asked to (A) rank a given set of Web pages with respect to a check-worthy claim based on their usefulness for fact-checking that claim, (B) classify these same Web pages according to their degree of usefulness for fact-checking the target claim, (C) identify useful passages from these pages, and (D) use the useful pages to predict the claim's factuality. CheckThat! provided a full evaluation framework, consisting of data in English (derived from fact-checking sources) and Arabic (gathered and annotated from scratch) and evaluation based on mean average precision (MAP) and normalized discounted cumulative gain (nDCG) for ranking, and F1 for classification. A total of 47 teams registered to participate in this lab, and fourteen of them actually submitted runs (compared to nine last year). The evaluation results show that the most successful approaches to Task 1 used various neural networks and logistic regression. As for Task 2, learning-to-rank was used by the highest scoring runs for subtask A, while different classifiers were used in the other subtasks. We release to the research community all datasets from the lab as well as the evaluation scripts, which should enable further research in the important tasks of check-worthiness estimation and automatic claim verification.
研究の動機と目的
- 政治的議論における主張のうち、事実確認が最も必要とされるもの(チェック価値推定)を特定する自動システムの開発と評価を目的とする。
- 特にアラビア語において、Web リソースを用いた自動的証拠取得と事実性予測を可能にする。
- 訓練および評価のためのアノテート済みデータを含む大規模かつ多言語のベンチマークを提供すること。
- 複数のソースからのアノテーションを集約することで、主張選択のバイアスを低減し、データセットの多様性を向上させること。
- 標準化された評価と共有リソースを通じて、信頼性があり根拠に基づいたフェイクニュース検出システムの開発を支援すること。
提案手法
- CheckThat! ラボは2つの主要タスクを導入した:タスク1(英語)では、録音された政治的討論や演説を用いた主張の優先順位付け。
- タスク2(アラビア語)には4つのサブタスクが含まれる:有用性に基づいてWebページをランク付け、関連性を分類し、有用な文章を抽出し、主張の真偽を予測する。
- タスク1のデータセットは、報道会見、演説、討論から得た新たな事実確認済み主張を加えて、CT-CWC-18 データセットを拡張した。
- タスク2では、新しいアラビア語データセットを手作業で収集し、主張、収集されたWebページ、および4つのサブタスク全般の複数アノテーターによる判断を含んだ。
- 評価には、ランク付けタスクにはMAPとnDCG、分類および事実性予測にはF1スコアが用いられた。
- 上位のシステムは、ニューラルネットワーク、ロジスティック回帰、勾配ブースティングやランダムフォレストなどのアンサンブルモデルを用い、一部のチームは外部データも活用した。

実験結果
リサーチクエスチョン
- RQ1政治的議論におけるチェック価値のある主張を特定するのに最も効果的な機械学習モデルは何か?
- RQ2与えられた主張の検証に役立つWebページをどれほど正確にランク付けできるか?
- RQ3有用なWebページを含めることで、主張の真偽予測の精度はどの程度向上するか?
- RQ4Webからの証拠を用いて、教師あり分類器が主張の事実性を効果的に予測できるか?
- RQ5複数ソースからのアノテーションを用いることで、事実確認システムにおける主張選択の信頼性とバイアスはどのように変化するか?
主な発見
- タスク1で最高スコアを記録したシステムは、ニューラルネットワークとロジスティック回帰を用い、主張の優先順位付けにおいてベースラインモデルを上回った。
- タスク2サブタスクA(ランク付け)では、学習によるランク付けモデルが最良の結果を達成し、証拠収集の有効性を示した。
- サブタスクD(事実性予測)では、サイクル2でF1スコアが0.62に達し、0.34のベースラインF1スコアを著しく上回った。
- 外部データは、テキスト帰属関係のコンponentの4回の実行で性能向上をもたらし、証拠理解における価値を示した。
- サブタスクDのサイクル1での参加が低かったため、有用なページの含みが真偽予測精度に与える影響について、明確な結論を下すことは困難だった。
- 本ラボでは、CT19-T1(英語)およびCT19-T2(アラビア語)の2つの包括的なデータセットに加え、評価スクリプトを公開し、今後の自動的事実確認研究を可能にした。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。