[論文レビュー] Cross-Domain Learning for Classifying Propaganda in Online Contents
本稿は、政治的演説、ニュース記事、ツイートのラベル付きデータを活用して、ドメイン間で転送可能なモデルを学習するためのクロスドメイン学習フレームワークを提案する。ペairワイズ順序付けLSTMと独自の損失関数(THR)を用いるアプローチは、限られたラベル付きデータのもとでも未学習ドメインにおける一般化性能を向上させ、過大表現や否定的感情といった言語的兆候を顕著なプロパガンダマーカーとして同定する。
As news and social media exhibit an increasing amount of manipulative polarized content, detecting such propaganda has received attention as a new task for content analysis. Prior work has focused on supervised learning with training data from the same domain. However, as propaganda can be subtle and keeps evolving, manual identification and proper labeling are very demanding. As a consequence, training data is a major bottleneck. In this paper, we tackle this bottleneck and present an approach to leverage cross-domain learning, based on labeled documents and sentences from news and tweets, as well as political speeches with a clear difference in their degrees of being propagandistic. We devise informative features and build various classifiers for propaganda labeling, using cross-domain learning. Our experiments demonstrate the usefulness of this approach, and identify difficulties and limitations in various configurations of sources and targets for the transfer step. We further analyze the influence of various features, and characterize salient indicators of propaganda.
研究の動機と目的
- 政治的演説、ソーシャルメディア、ニュース記事のドメイン間でクロスドメイン学習を活用することで、ラベル付きプロパガンダデータの不足というボトルネックを緩和すること。
- ラベル付きデータが限られる状況においても、あるソースタイプから別のタイプに知識を転送することで、ドメイン特異的分類器の限界を克服すること。
- 訓練信号としての異なるデータソース(例:演説 vs ニュース vs ツイート)がクロスドメインプロパガンダ検出に与える影響を調査すること。
- 簡単な偏りのある言語を超えて、微妙な修辞的形態のプロパガンダを捉える、強固で一般化可能な分類フレームワークを構築すること。
- さまざまな言語的特徴およびサンプリング戦略が、クロスドメイン転送性能に与える影響を分析すること。
提案手法
- 政治的演説(例:ヨーゼフ・ゲッベルズ)、ニュース記事、ツイートを含むマルチドメインデータセットを収集・アノテートし、プロパガンダ的発言と穏健な発言を比較するペアワイズ順序ラベル付けスキームを用いる。
- 二値ラベルではなく順序付き文ペアから学習する、ペアワイズ順序付けLSTMモデル(LSTMR)を設計し、信頼性の高い順序ペアを優先する独自の損失関数(THR)を用いる。
- 語彙的(例:怒り、呪いの語、確信を表す語などLIWCカテゴリ)、構文的、意味的特徴(例:TF-IDF、BERT埋め込み)を用い、ドメインバイアスを低減するための固有名詞の除去を実施する。
- ペアワイズ学習設定における訓練ペアのバランスをとるためにオーバーサンプリングおよびアンダーサンプリング戦略を採用し、そのモデル一般化性能への影響を評価する。
- 複数のドメイン転送方向(例:ニュース→ツイート、演説→ニュース)でモデルを訓練・評価し、転送可能性および耐性を評価する。
- 訓練中に低信頼度の順序ペアを軽減する独自損失関数(THR)を採用し、クロスドメイン性能を向上させるが、ややドメイン内性能が低下する代償を負う。
実験結果
リサーチクエスチョン
- RQ1政治的演説のデータで学習したモデルは、ニュース記事やソーシャルメディア投稿におけるプロパガンダ分類にどの程度一般化できるか?
- RQ2訓練ドメインの選択(例:演説 vs ニュース vs ツイート)が、クロスドメインプロパガンダ検出モデルの性能に与える影響は何か?
- RQ3特に提案されたTHR損失関数が、ペアワイズ順序付け学習におけるクロスドメイン転送性能に与える影響は何か?
- RQ4感情の強度、誇張、否定的センチメントなどの言語的特徴のうち、多様なドメインにわたってプロパガンダを示すのに最も顕著なものは何か?
- RQ5オーバーサンプリングおよびアンダーサンプリングのサンプリング戦略が、ペアワイズ学習設定におけるクロスドメイン学習の安定性と有効性に与える影響は何か?
主な発見
- 提案されたLSTMRモデルにTHR損失関数を適用した場合、特にスピーチやツイートなどのクロスドメインテストセットにおいて、他の損失関数を上回る性能を示し、一般化性能の向上を実証した。
- ニュースデータで学習した場合に、スピーチやツイートで高いF1スコアを達成しており、効果的な知識転送が実現していることが示された。
- LIWCカテゴリ(怒り、呪いの語、確信)や「嘘」「衝撃的」「まったく」「壊滅的」などの高頻度語が、ドメインを問わずプロパガンダの強力な兆候であることが判明した。
- オーバーサンプリング戦略は性能向上が限定的であり、場合によっては結果を劣化させる傾向があり、クロスドメイン設定におけるペアワイズ順序付け学習ではデータ拡張に限界があることを示唆している。
- アンダーサンプリングは混合結果を示した:一部のデータセット(例:SPE_A)では性能が向上したが、他のデータセットでは不安定または低下した。これは、ドメイン固有のデータ不足課題が存在することを示している。
- 本研究は、クロスドメイン学習がラベル付けのボトルネックを緩和することは可能であるが、依然として顕著な性能ギャップが残っており、今後の研究においてより良いデータ拡張法およびドメイン不変表現学習の開発が不可欠であることを明らかにした。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。