Skip to main content
QUICK REVIEW

[論文レビュー] Dataset of Propaganda Techniques of the State-Sponsored Information Operation of the People's Republic of China

Rong-Ching Chang, Chun-Ming Lai|arXiv (Cornell University)|Jun 14, 2021
Misinformation and Its Impacts参考文献 14被引用数 10
ひとこと要約

本稿では、中華人民共和国の国家支援Twitterアカウントにリンクするものとして、中国語で作成された最初の多言語・多ラベル付きプロパガンダ技法データセットを紹介する。微調整されたBERTを用いた多ラベルテキスト分類において、モデルは80.35%の正答率と85.43%のマイクロF1スコアを達成し、クラス不均衡にもかかわらず優れた性能を示しており、多言語的・多プラットフォーム的なプロパガンダ検出研究の基盤を提供する。

ABSTRACT

The digital media, identified as computational propaganda provides a pathway for propaganda to expand its reach without limit. State-backed propaganda aims to shape the audiences' cognition toward entities in favor of a certain political party or authority. Furthermore, it has become part of modern information warfare used in order to gain an advantage over opponents. Most of the current studies focus on using machine learning, quantitative, and qualitative methods to distinguish if a certain piece of information on social media is propaganda. Mainly conducted on English content, but very little research addresses Chinese Mandarin content. From propaganda detection, we want to go one step further to provide more fine-grained information on propaganda techniques that are applied. In this research, we aim to bridge the information gap by providing a multi-labeled propaganda techniques dataset in Mandarin based on a state-backed information operation dataset provided by Twitter. In addition to presenting the dataset, we apply a multi-label text classification using fine-tuned BERT. Potentially this could help future research in detecting state-backed propaganda online especially in a cross-lingual context and cross platforms identity consolidation.

研究の動機と目的

  • 中国語におけるラベル付きプロパガンダ技法データセットの不足、特に国家支援情報作戦を対象に、その問題を解決すること。
  • 中国語SNSコンテンツに適用された、細分化された多ラベル付きのプロパガンダ技法データセットを提供すること。
  • 標準化された多言語データセットを提供することで、国家支援プロパガンダに関する多言語的・多プラットフォーム的研究を可能にすること。
  • 中国語コンテンツに対して微調整されたBERTモデルを訓練・評価することにより、英語以外の文脈におけるプロパガンダ検出を向上させること。
  • 国家支援コンテンツの言語的特徴を分析することで、アイデンティティ統合、情報源の特定、スタンス検出に関する今後の研究を支援すること。

提案手法

  • 2019年7月にTwitterが公開した、国家関連のTwitterアカウントから抽出した9,950件の中国語文から構成されるデータセットを構築した。
  • 先行研究を基に21のプロパガンダ技法(例:『恐怖への訴え』『感情的言語』『ステレオタイプ』など)を定義した。
  • 複数ラベル付与方式を適用し、1文が複数のプロパガンダ技法に同時にタグ付け可能であるようにした。
  • 20次元の線形層とドロップアウト層を用いて、BERTモデルを微調整した。
  • 最適な収束を得るため、Adam最適化手法を用い、学習率1e-5で2エポックにわたりBCEWithLogitsLossを適用した。
  • 80/20のトレイン・テスト分割に基づき、正答率、マイクロ平均F1スコア、マクロ平均F1スコアを用いて性能を評価した。

実験結果

リサーチクエスチョン

  • RQ1中華人民共和国の国家支援Twitterアカウントが生成する中国語コンテンツにおいて、どのようなプロパガンダ技法が体系的に使用されているか?
  • RQ2微調整されたBERTモデルは、中国語テキストにおいて複数のプロパガンダ技法を同時に分類する際に、どの程度効果的か?
  • RQ3データセットにおけるクラス不均衡は、多ラベルプロパガンダ分類モデルの性能にどの程度影響を及えるか?
  • RQ4中国語におけるプロパガンダの言語的特徴を用いて、情報源の特定や、複数プラットフォーム間でのアカウントの関連付けが可能か?
  • RQ5中華人民共和国の国家支援プロパガンダの言語的パターンは、英語や他の言語と比べてどのように異なるか?

主な発見

  • 2エポックにわたり、トレーニング損失が0.71102から0.05953に低下し、急速な収束が確認された。
  • テストセットにおいて全体の正答率が80.352%に達し、多ラベルタスクにおける優れた一般化性能を示した。
  • マイクロ平均F1スコアが85.431%に達し、すべてのサンプルを統合的に評価した際の高い性能を示した。
  • マクロ平均F1スコアは20.803%にとどまり、クラス不均衡のため個々のラベル間での性能のばらつきが顕著に現れた。
  • データセットには21のプロパガンダ技法でラベル付けされた9,950件の文が含まれており、1つのラベルは出現回数がゼロであることが判明し、データの不均衡が顕著であることが示された。
  • 中華人民共和国の国家支援キャンペーンの主な標的は、亡命中国人、人権弁護士、香港の抗議活動参加者であり、既知のフェイクニュースキャンペーンと整合的であった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。