[論文レビュー] Hostility Detection and Covid-19 Fake News Detection in Social Media
本稿では、ヒンディー語(デヴァナガリー文字)および英語のソーシャルメディア投稿における敵対的発言およびフェイクニュースの検出のためのアンサンブルモデルを提案する。Hindi BERT、FastText、悪意ある言語検出、メタデータ特徴量を組み合わせたもので、粗粒度の敵対的発言検出で0.97のF1スコア、英語のフェイクニュース検出で0.93のF1スコアを達成。大規模なBERTベースのモデルを上回る性能を発揮し、軽量な埋め込み表現とエンティティに配慮した特徴量を活用している。
Withtheadventofsocialmedia,therehasbeenanextremely rapid increase in the content shared online. Consequently, the propagation of fake news and hostile messages on social media platforms has also skyrocketed. In this paper, we address the problem of detecting hostile and fake content in the Devanagari (Hindi) script as a multi-class, multi-label problem. Using NLP techniques, we build a model that makes use of an abusive language detector coupled with features extracted via Hindi BERT and Hindi FastText models and metadata. Our model achieves a 0.97 F1 score on coarse grain evaluation on Hostility detection task. Additionally, we built models to identify fake news related to Covid-19 in English tweets. We leverage entity information extracted from the tweets along with textual representations learned from word embeddings and achieve a 0.93 F1 score on the English fake news detection task.
研究の動機と目的
- ソーシャルメディアにおける敵対的かつフェイクなコンテンツの増加という問題に取り組むこと、特にヒンディー語のような低リソース言語を対象とする。
- デヴァナガリー文字(ヒンディー語)および英語のツイートにおけるフェイクニュースおよび敵対的発言の検出精度を、ハイブリッドNLP技術を用いて向上させること。
- 言語的特徴量、メタデータ、エンティティ情報のモデルパフォーマンスへの影響を評価すること。
- 英語のフェイクニュースデータセットにおける誤標記されたサンプルを同定することで、弱教師あり学習の可能性を検討すること。
提案手法
- モデルは、ヒンディー語テキストにおける表現学習のため、軽量なアンサンブルとしてFastTextとHindi BERTの埋め込み表現を用いる。
- 分類性能の向上を図るため、URL、メンション、ハッシュタグ、絵文字の数といったメタデータ特徴量を統合する。
- 攻撃的・嫌がらせ的言語の検出器を特徴量として用い、攻撃的・差別的発言の検出精度を向上させる。
- 英語のフェイクニュース検出では、Word2Vec埋め込み表現とエンティティ情報、メタデータをBoW(bag-of-words)アプローチで統合する。
- 最終的なアンサンブルモデルは、LSTMおよび全結合層を含む複数のベースモデルを統合することで、一般化性能を向上させる。
- 各特徴量(言語的、メタデータ、エンティティベース)の寄与度を測定するためのアブレーションスタディを実施する。
実験結果
リサーチクエスチョン
- RQ1軽量な単語埋め込み表現に加え、メタデータおよびエンティティ特徴量を組み合わせることで、BERTのような大規模な事前学習モデルを上回るフェイクニュース検出性能を達成できるか?
- RQ2多言語および言語特化型BERTモデルは、ヒンディー語のような低リソース言語における敵対的発言検出にどの程度有効か?
- RQ3メタデータおよび悪意ある言語特徴量は、敵対的発言検出モデルの性能向上にどの程度寄与するか?
- RQ4モデルは英語のフェイクニュースデータセットにおける誤標記されたサンプルを同定・是正でき、将来的な弱教師あり学習に応用可能か?
- RQ5多クラス・マルチラベルの敵対的発言検出において、言語的特徴量、メタデータ、エンティティ特徴量の相対的な寄与度はどの程度か?
主な発見
- アンサンブルモデルは、ヒンディー語における粗粒度の敵対的発言検出で0.97の加重F1スコアを達成し、共有タスクで45チーム中5位となった。
- 細粒度分類では、0.62の加重F1スコアを達成し、45チーム中7位となった。
- URL、メンション、ハッシュタグ、絵文字の数といったメタデータ特徴量の追加により、細粒度分類のF1スコアが最大7%向上した。
- 英語のフェイクニュースタスクにおいて、大規模なBERTベースのモデルを上回り、軽量なFastText-LSTMアンサンブルでテストデータで0.95のF1スコアを達成した。
- エンティティ情報とメタデータの統合により、性能が顕著に向上し、最良のモデルでは英語のフェイクニュース検出で0.97のF1スコアを達成した。
- モデルは英語のフェイクニュースデータセットにおける複数の誤標記されたサンプルを正しく同定した。これは、将来的なデータキュレーションにおける弱教師あり学習の可能性を示唆している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。