Skip to main content
QUICK REVIEW

[論文レビュー] MiDAS: Multi-integrated Domain Adaptive Supervision for Fake News Detection

Abhijit Suprem, Calton Pu|arXiv (Cornell University)|May 19, 2022
Misinformation and Its Impacts被引用数 5
ひとこと要約

MiDASは、ドメイン不変埋め込みと局所リプシッツ滑らかさを用いて、各新しいサンプルに対して最も関連性の高い事前学習モデルを選択する、マルチ統合ドメイン適応型監視フレームワークを提案する。トレーニングデータの重複度に基づく動的モデルランク付けにより、9つの多様なフェイクニュースデータセットで最先端の性能を達成し、弱い監視ベースラインと比較して10%以上の精度向上を実現する。

ABSTRACT

COVID-19 related misinformation and fake news, coined an 'infodemic', has dramatically increased over the past few years. This misinformation exhibits concept drift, where the distribution of fake news changes over time, reducing effectiveness of previously trained models for fake news detection. Given a set of fake news models trained on multiple domains, we propose an adaptive decision module to select the best-fit model for a new sample. We propose MiDAS, a multi-domain adaptative approach for fake news detection that ranks relevancy of existing models to new samples. MiDAS contains 2 components: a doman-invariant encoder, and an adaptive model selector. MiDAS integrates multiple pre-trained and fine-tuned models with their training data to create a domain-invariant representation. Then, MiDAS uses local Lipschitz smoothness of the invariant embedding space to estimate each model's relevance to a new sample. Higher ranked models provide predictions, and lower ranked models abstain. We evaluate MiDAS on generalization to drifted data with 9 fake news datasets, each obtained from different domains and modalities. MiDAS achieves new state-of-the-art performance on multi-domain adaptation for out-of-distribution fake news classification.

研究の動機と目的

  • 進化する誤情報パターンによる概念ずれの影響を受けるフェイクニュース検出における一般化性能の低下を是正すること。
  • 特にCOVID-19インフォデミックのような進化するトピックに起因する現実世界の概念ずれにおいて、単一ドメインモデルのクロスドメインおよび分布外設定における限界を克服すること。
  • 各入力サンプルのトレーニングデータ分布との関連性に基づき、最適なモデルを動的に選択する意思決定モジュールの開発。
  • 統一されたドメイン不変表現空間を用いて複数のファインチューニング済みモデルを統合し、早期フェイクニュース検出における一般化性能とロバスト性を向上させること。

提案手法

  • 複数のドメインからの入力を、ドメインに依存しない埋め込み空間にマップするドメイン不変エンコーダーを採用し、ドメイン間で意味的類似性を保持する。
  • テストサンプル周辺の埋め込み空間における局所リプシッツ滑らかさを用いて、モデルの関連性を推定する——高い滑らかさは、モデルのトレーニングデータと高い整合性を示す。
  • 推定された滑らかさ(トレーニングデータ重複度の代理指標)に基づきモデルをランク付けし、予測に使用するのは上位ランクのモデルのみとし、低ランクのモデルは予測を控える。
  • それぞれのトレーニングデータと連携して事前学習済みおよびファインチューニング済みモデルを統合し、ドメイン不変表現を共同で学習するとともに、モデル間比較を可能にする。
  • 各テストサンプルのεボール内での摂動に基づくサンプリングを実施し、局所滑らかさを推定し、リプシッツ定数Lをモデルの信頼性の指標として用いる。
  • 近隣数(m)とεしきい値を調整して、予測カバレッジと精度のバランスを最適化し、アブレーションスタディにより、ロバストネスと一般化性能のトレードオフを明らかにする。

実験結果

リサーチクエスチョン

  • RQ1分布外の新しいサンプルに対して、事前学習済みのドメイン特化型フェイクニュース検出器の集合から最も関連性の高いモデルを効果的に選択する方法は何か?
  • RQ2ドメイン不変埋め込み空間における局所リプシッツ滑らかさは、モデルの関連性と予測精度の信頼できる代理指標として機能するか?
  • RQ3共有エンコーダーを介して複数のドメイン特化型モデルを統合することで、ずれが生じた未観測のフェイクニュースデータに対する一般化性能はどのように向上するか?
  • RQ4局所滑らかさ推定における滑らかさしきい値と近隣数を調整する際、予測カバレッジと精度のトレードオフはどのように変化するか?
  • RQ5概念ずれ下でのマルチドメインフェイクニュース検出において、MiDASは弱い監視法やベースラインのドメイン適応手法をどの程度上回るか?

主な発見

  • MiDASは、異なるドメインとモダリティをカバーする9つの多様なフェイクニュースデータセットで最先端の性能を達成し、概念ずれ下でも強力な一般化性能を示した。
  • 弱いラベル付けベースラインと比較して、特に分布外設定において10%以上の検出精度向上を達成した。
  • m=1(最近傍)ではカバレッジが最小(0.03–0.05)だが、精度が最高(F1最高0.97)となり、mを150に引き上げるとカバレッジが1.00に上昇するが、精度は低下(一部のデータセットでF1が0.57に低下)する。
  • アブレーションスタディにより、各構成要素に安定した収束が確認され、完全なMiDASモデルがアブレーション変種よりも精度とカバレッジの両面で優れた性能を示した。
  • mパラメータとεしきい値の調整により、カバレッジと精度のバランスを効果的にとることができ、緩い滑らかさしきい値を許容することでより多くのモデルが予測可能になるが、その代わり精度が低下することが示された。
  • coaidデータセットでは、m=100のF1スコア0.73からm=150のF1スコア0.56に低下したが、カバレッジは0.98から1.00へのわずかな上昇にとどまり、過度に許容的なしきい値が性能を劣化させることを示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。