[論文レビュー] RumourEval 2019: Determining Rumour Veracity and Support for Rumours
RumourEval 2019 は、2017年のベンチマークを拡張し、Reddit および Twitter からの多言語データを追加することで、自動的ないてきな事実確認を進める共同課題を提案した。また、統一されたスタンス分類および真偽分類タスクを導入した。真偽予測を支援するため、スタンス検出の向上を重視し、評価にはマクロ F1 および RMSE を使用。マルチモodal およびマルチリンガルないてきな分析分野におけるイノベーションを促進するため、最先端のベースラインを提供した。
This is the proposal for RumourEval-2019, which will run in early 2019 as part of that year's SemEval event. Since the first RumourEval shared task in 2017, interest in automated claim validation has greatly increased, as the dangers of "fake news" have become a mainstream concern. Yet automated support for rumour checking remains in its infancy. For this reason, it is important that a shared task in this area continues to provide a focus for effort, which is likely to increase. We therefore propose a continuation in which the veracity of further rumours is determined, and as previously, supportive of this goal, tweets discussing them are classified according to the stance they take regarding the rumour. Scope is extended compared with the first RumourEval, in that the dataset is substantially expanded to include Reddit as well as Twitter data, and additional languages are also included.
研究の動機と目的
- SNSにおけるフェイクニュースおよび誤情報の増加する課題に対処するため、自動的ないてきな事実確認システムを発展させる。
- 2017年の RumourEval 共同課題を拡張し、Reddit データおよび新しい言語(ロシア語およびデンマーク語)を統合することで、データセットの多様性と現実性を向上させる。
- サブタスク A(スタンス分類)と B(真偽予測)を統合した単一のタスクにすることで、真偽検出の向上に向けたスタンス情報の活用を促進する。
- 参加者がスタンス出力を真偽予測モデルに統合できるようにすることで、情報活用の分野におけるイノベーションを促進する。
- 公開可能で再現可能な研究を支援するため、Twitter および Reddit データポリシーに準拠したキュレート済みデータセットをリリースし、削除済みコンテンツの対応メカニズムを整備する。
提案手法
- Twitter および Reddit から、真偽ラベル(true/false/unverified)が付与されたいてきな事実に関する元のツイートおよびディスカッションスレッドを収集・アノテートする。
- ユーザーの反応を、4つのスタンスカテゴリ(支持、否定、質問、コメント)に分類し、評価には主に最初の3つに注目する。
- スタンス分類の評価には、マクロ平均 F1 スコアを使用し、「コメント」クラスを除外することで、情報量の多い反応を優先する。
- 真偽予測の評価には、マイクロ平均精度と、信頼度スコアのための平均二乗誤差(RMSE)を用いる。
- 深層学習およびアンサンブルモデルを含む、RumourEval 2017 のトップパフォーマンスモデルに基づく最先端のベースラインを、スタンスおよび真偽タスクの両方で提供する。
- ツイートの削除を確認し、Twitter の開発者ポリシーに準拠することで、データの整合性を確保する。必要に応じてデータセットを更新するメカニズムを整備する。
実験結果
リサーチクエスチョン
- RQ1スタンス分類(支持/否定/質問)が、いてきな事実の真偽予測の正確性にどの程度寄与するか。
- RQ2Reddit データおよび多言語コンテンツ(ロシア語、デンマーク語)の統合が、いてきな事実検出におけるモデルの汎化性能およびパフォーマンスに与える影響は何か。
- RQ3スタンスと真偽予測を統合したタスク設計は、より効果的で革新的なシステムアーキテクチャの構築を促進できるか。
- RQ4さまざまな機械学習および深層学習モデルは、マルチリンガルおよびマルチプラットフォームのデータにおいて、いてきな事実確認の分野でどの程度の性能を示すか。
- RQ5信頼度スコアのキャリブレーション(RMSE で測定)は、自動的ないてきな事実確認システムの実用的導入にどのような影響を与えるか。
主な発見
- 2019年の RumourEval 共同課題では、Reddit および多言語コンテンツ(ロシア語およびデンマーク語)を含むデータセットが拡張され、多様性と現実性が顕著に向上した。
- スタンス分類の評価には、支持・否定・質問クラスのマクロ F1 が使用され、「コメント」クラスは除外されており、情報量の多い反応を優先する。
- 真偽予測は、マイクロ平均精度と、信頼度スコアのための RMSE を用いて評価され、二値分類と細分化されたパフォーマンス評価の両方が可能になった。
- LSTM や CNN アーキテクチャを含む、RumourEval 2017 のトップパフォーマンスモデルに基づくベースラインシステムが提供され、研究手法の革新を支援した。
- タスク設計により、スタンス出力を真偽モデルに統合することが促進され、実世界のワークフロー(スタンス信号が真実性評価に寄与する)を反映した。
- Twitter の開発者ポリシーを尊重するためのデータガバナンスプロトコルが整備され、削除されたツイートの確認およびデータセットの更新メカニズムが整備された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。