Skip to main content
QUICK REVIEW

[論文レビュー] Too Many Claims to Fact-Check: Prioritizing Political Claims Based on Check-Worthiness

Yavuz Selim Kartal, Busra Guvenen|arXiv (Cornell University)|Apr 17, 2020
Misinformation and Its Impacts参考文献 22被引用数 4
ひとこと要約

本稿では、語彙埋め込み、品詞タグ、比較・最上級構文、分野固有の議論を呼び起こすトピックといった手作業で作成された特徴量と微調整されたBERTを組み合わせることで、検証の価値がある政治的主張を優先順位付けするBERTベースのハイブリッドモデルを提案する。このモデルは、CLEF Check That! 2018で0.255のMAP、2019年で0.176のMAPを達成し、これまでのあらゆる手法を上回る最先端の性能を発揮した。

ABSTRACT

The massive amount of misinformation spreading on the Internet on a daily basis has enormous negative impacts on societies. Therefore, we need automated systems helping fact-checkers in the combat against misinformation. In this paper, we propose a model prioritizing the claims based on their check-worthiness. We use BERT model with additional features including domain-specific controversial topics, word embeddings, and others. In our experiments, we show that our proposed model outperforms all state-of-the-art models in both test collections of CLEF Check That! Lab in 2018 and 2019. We also conduct a qualitative analysis to shed light-detecting check-worthy claims. We suggest requesting rationales behind judgments are needed to understand subjective nature of the task and problematic labels.

研究の動機と目的

  • 膨大な量の誤情報のため、事実確認の対象となる政治的主張を優先順位付けするという課題に対処すること。
  • 事実確認担当者が最も重要な主張に集中できるように、検証の価値がある主張の順位付けを行う自動化されたシステムの開発。
  • ハイブリッドディープラーニングと特徴工学を用いて、主張の優先順位付けタスクにおける既存の最先端モデルを上回る性能の向上。
  • 定性的分析を通じて、検証の価値に関する主観的で一貫性のないアノテーションの性質を調査すること。
  • モデルの解釈可能性とデータ品質の向上のため、アノテーションの根拠(rationales)の収集を提唱すること。

提案手法

  • 2018年および2019年のCLEF Check That! データセットを用いて、主張の優先順位付けタスクに特化したBERTモデルを微調整する。
  • BERTの文脈的表現に加え、語彙埋め込み、品詞タグ、比較・最上級構文の識別子、分野固有の議論を呼び起こすトピックといった追加特徴量を統合する。
  • BERTの予測結果と特徴工学で得た特徴量のアンサンブルを用いて、ロジスティック回帰分類器を訓練し、主張の検証の価値に基づいて順位付けする。
  • 各コンポonentのモデル性能への寄与度を評価するために、特徴量のアブレーションスタディを実施する。
  • モデルの予測結果とアノテーションの定性的分析を実施し、ラベルの主観性や一貫性の欠如を評価する。
  • アノテーションの根拠(rationales)を収集することで、人間の判断のばらつきをよりよく理解し、今後のデータ収集の改善を図る。

実験結果

リサーチクエスチョン

  • RQ1膨大な量の誤情報に直面する中で、政治的主張を効果的に事実確認の優先順位に並べることはどのように達成できるか?
  • RQ2BERTと手作業で作成された特徴量を組み合わせることで、単体のモデルに比べて検証の価値の順位付け性能がどの程度向上するか?
  • RQ3主観的で一貫性のない人間によるアノテーションが、主張の優先順位付けベンチマークの信頼性にどのように影響するか?
  • RQ4アノテーションの根拠(rationales)を収集することで、意見の不一致を解消し、モデルの学習と評価を改善できるか?
  • RQ5政治的主張における検証の価値を最も効果的に予測する特徴量は何か?

主な発見

  • 提案されたBERTベースのハイブリッドモデルは、CLEF Check That! 2018のテストデータセットで平均平均精度(MAP)0.255を達成し、これまでのあらゆる最先端モデルを上回った。
  • CLEF Check That! 2019のテストデータセットでは、MAPが0.176に達し、再びすべての先行手法を上回った。
  • 特徴量のアブレーション分析から、BERTと語彙埋め込みが最も影響力のある特徴量であることが判明したが、手作業で作成した語彙リストや分野固有の議論を呼び起こすトピックも顕著な寄与を示した。
  • 定性的分析の結果、検証の価値に関するアノテーションは非常に主観的であり、意味的に類似した主張に対しても一貫性のないラベル付けが行われていることが明らかになった。
  • 今後のデータ収集の改善のため、将来的なシステムの向上のためには、アノテーションの根拠(rationales)の収集が不可欠であると結論づけた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。