[論文レビュー] Combating Hostility: Covid-19 Fake News and Hostile Post Detection in Social Media
本論文は、SVMとtf-idf、LPSVMとn-gram特徴量を用いて、SNSにおける新型コロナウイルス関連のフェイクニュースと敵対的コンテンツを検出する機械学習およびディープラーニングシステムを提示している。フェイクニュース検出では94.39%のF1スコア、敵対的投稿分類では86.03%の粗い粒度のF1スコアを達成した。顕著な点として、BERTのファインチューニングにより、フェイクニュース検出で98%のF1スコア、敵対的分類で97%のF1スコアに性能が著しく向上した。
This paper illustrates a detail description of the system and its results that developed as a part of the participation at CONSTRAINT shared task in AAAI-2021. The shared task comprises two tasks: a) COVID19 fake news detection in English b) Hostile post detection in Hindi. Task-A is a binary classification problem with fake and real class, while task-B is a multi-label multi-class classification task with five hostile classes (i.e. defame, fake, hate, offense, non-hostile). Various techniques are used to perform the classification task, including SVM, CNN, BiLSTM, and CNN+BiLSTM with tf-idf and Word2Vec embedding techniques. Results indicate that SVM with tf-idf features achieved the highest 94.39% weighted $f_1$ score on the test set in task-A. Label powerset SVM with n-gram features obtained the maximum coarse-grained and fine-grained $f_1$ score of 86.03% and 50.98% on the task-B test set respectively.
研究の動機と目的
- SNS上における新型コロナウイルスパンデミックに関連するフェイクニュースおよび敵対的コンテンツ(例:差別的発言、中傷、攻撃的言語)を自動で検出するシステムの開発。
- 多言語およびリソースが限られた環境下での、敵対的コンテンツクラス間のクラスの不均衡および重複する特徴の課題に対処すること。
- リソースが限られた多言語環境下で、従来の機械学習モデル(SVM、CNN、BiLSTM)とディープラーニングおよび事前学習モデル(例:BERT)の性能を比較評価すること。
- 分類の失敗パターンを特定するため、定性的および定量的な誤差分析を実施し、特に代表が不足している敵対的クラスに対して注目すること。
- 短く非公式なテキストにおける誤情報および敵対的行動の検出において、特徴工学(tf-idf、Word2Vec、n-gram)およびモデルアーキテクチャ(CNN+BiLSTM)の有効性を調査すること。
提案手法
- 英語(タスク-A)およびヒンディー語(タスク-B)のテキスト分類において、tf-idfおよびWord2Vec埋め込みを特徴表現に用いたSVM、CNN、BiLSTM、およびCNN+BiLSTMモデルを採用した。
- タスク-Bにおけるマルチラベルマルチクラス分類に対処するため、n-gram特徴抽出(1-3)とラベルパワー集合(LP)変換を実施した。
- タスク-Bにおけるマルチラベル問題変換に、バイナリリレヴァランス(BR)、ラベルパワー集合(LP)、およびクラシファイアチェーン(CC)手法を適用した。
- ハイパーパramータチューニングのためのバリデーションセットと、最終的な性能評価のためのテストセットを用いて、モデルを訓練および評価した。
- 共有タスク終了後、タスク-Aおよびタスク-Bの両方でBERTモデルをファインチューニングし、事前学習言語モデルの性能への影響を評価した。
- 誤分類例に対する混同行列分析および定性的誤差分析を実施し、言語的および文脈的課題を特定した。
実験結果
リサーチクエスチョン
- RQ1リソースが限られた多言語環境下で、従来の機械学習モデル(例:SVM)とディープラーニングモデル(例:CNN、BiLSTM)は、フェイクニュースおよび敵対的コンテンツ検出においてどのように比較されるか?
- RQ2短く非公式なSNSテキストの文脈において、異なる特徴抽出技術(tf-idf、Word2Vec、n-gram)が分類性能に与える影響は何か?
- RQ3全体のF1スコアが高くても、特定の敵対的クラス(例:中傷、差別的、攻撃的)に対して高い偽陰性率を示すのはなぜか?
- RQ4事前学習言語モデル(例:BERT)をファインチューニングすることで、CONSTRAINT共有タスクにおけるフェイクニュースおよび敵対的コンテンツ検出の性能はどの程度向上するか?
- RQ5言語的および文脈的要因として、特に差別的、攻撃的、中傷的という重複する敵対的カテゴリ間で、誤分類が生じる主な要因は何か?
主な発見
- SVMとtf-idf特徴量を組み合わせたモデルは、タスク-A(英語でのフェイクニュース検出)のテストセットで最高の加重F1スコア94.39%を達成した。
- ラベルパワー集合SVMとn-gram(1,3)特徴量を組み合わせたモデルは、タスク-B(ヒンディー語での敵対的投稿検出)で、粗い粒度のF1スコア86.03%および細かい粒度のF1スコア50.98%を達成した。
- Word2Vec埋め込みを用いたCNN+BiLSTMモデルは、タスク-Aで加重F1スコア92.43%を達成したが、これはSVMベースラインより低く、この低データ環境下ではディープラーニングモデルが性能を発揮しなかったことを示している。
- 共有タスク終了後のファインチューニングにより、BERTモデルはタスク-Aで98%のF1スコア、タスク-Bで97%の粗い粒度のF1スコアを達成し、ベースラインモデルに比べて顕著な性能向上を示した。
- 中傷的、差別的、攻撃的なコンテンツに対して高い偽陰性率が観察され、実際に存在する投稿のうち、それぞれ169件中25件、134件中91件、219件中108件が正しく分類された。これは、繊細なまたは文脈依存的な敵対的行動の検出が困難であることを示している。
- 誤分類の主な要因は、頻出語の『covid19』、『vaccine』、『modi』などであり、また、公式機関(例:FDA、WHO)を根拠とする主張も、真実とフェイクの境界を曇らせる要因となっており、敵対的クラス間の意味的特徴の重複が主な要因であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。