Skip to main content
QUICK REVIEW

[论文解读] Cross-Domain Learning for Classifying Propaganda in Online Contents

Liqiang Wang, Xiaoyu Shen|arXiv (Cornell University)|Nov 13, 2020
Misinformation and Its Impacts参考文献 15被引用 4
一句话总结

本文提出了一种用于宣传检测的跨领域学习框架,利用标注的政治演讲、新闻文章和推文来训练可在不同领域间迁移的模型。通过使用带有自定义损失函数(THR)的成对排序LSTM,该方法在标注数据有限的情况下,实现了对未见领域的更好泛化能力,识别出夸张语言和负面情绪等语言特征作为显著的宣传标志。

ABSTRACT

As news and social media exhibit an increasing amount of manipulative polarized content, detecting such propaganda has received attention as a new task for content analysis. Prior work has focused on supervised learning with training data from the same domain. However, as propaganda can be subtle and keeps evolving, manual identification and proper labeling are very demanding. As a consequence, training data is a major bottleneck. In this paper, we tackle this bottleneck and present an approach to leverage cross-domain learning, based on labeled documents and sentences from news and tweets, as well as political speeches with a clear difference in their degrees of being propagandistic. We devise informative features and build various classifiers for propaganda labeling, using cross-domain learning. Our experiments demonstrate the usefulness of this approach, and identify difficulties and limitations in various configurations of sources and targets for the transfer step. We further analyze the influence of various features, and characterize salient indicators of propaganda.

研究动机与目标

  • 通过在新闻、社交媒体和政治演讲之间进行跨领域学习,解决标注宣传数据有限的瓶颈问题。
  • 通过将一种来源类型的知识迁移到另一来源类型,克服领域特定分类器的局限性,特别是在标注数据稀缺的情况下。
  • 研究不同数据来源(如演讲 vs. 新闻 vs. 推文)作为跨领域宣传检测训练信号的有效性。
  • 开发一种鲁棒且可泛化的分类框架,捕捉超越简单情绪化语言的微妙修辞形式的宣传。
  • 分析各种语言特征和采样策略对跨领域迁移性能的影响。

提出的方法

  • 收集并标注一个多领域数据集,包括政治演讲(例如,约瑟夫·戈培尔)、新闻文章和推文,采用成对序数标注方案,用于比较具有宣传性与语气平和的演讲者。
  • 设计一种成对排序LSTM模型,称为LSTMR,其从排序的句子对中学习,而非二元标签,使用自定义损失函数(THR)优先处理高置信度的排序对。
  • 采用一系列语言特征:词汇特征(如LIWC类别中的愤怒、粗俗、确定性)、句法特征和语义特征(如TF-IDF、BERT嵌入),并移除专有名词以减少领域偏差。
  • 实施过采样和欠采样策略,以在成对学习设置中平衡训练对,并评估其对模型泛化能力的影响。
  • 在多个领域迁移方向(如新闻→推文、演讲→新闻)上训练和评估模型,以评估迁移能力和鲁棒性。
  • 使用一种自定义损失函数(THR),在训练过程中降低低置信度排序对的权重,从而在轻微牺牲领域内性能的代价下,提升跨领域性能。

实验结果

研究问题

  • RQ1在政治演讲上训练的模型在多大程度上能泛化到新闻文章和社交媒体帖子的宣传分类?
  • RQ2训练领域(如演讲 vs. 新闻 vs. 推文)的选择在多大程度上影响跨领域宣传检测模型的性能?
  • RQ3不同损失函数(尤其是所提出的THR损失)对成对排序学习中跨领域迁移性能的影响如何?
  • RQ4哪些语言特征(如情感强度、夸张、负面情绪)在不同领域中最具宣传性指示意义?
  • RQ5采样策略(过采样和欠采样)在成对学习设置中如何影响跨领域训练的稳定性和有效性?

主要发现

  • 所提出的LSTMR模型配合THR损失函数在各种损失函数中表现最优,尤其在如演讲和推文等跨领域测试集上,展现出更强的泛化能力。
  • 该模型在跨领域迁移任务中取得了显著的F1分数,特别是在以新闻数据为训练集、在演讲或推文上进行测试时,表明知识迁移效果良好。
  • 语言特征如LIWC类别(愤怒、粗俗、确定性)以及高频词如“谎言”、“震惊”、“绝对”和“毁灭性”在不同领域中均为宣传的强指标。
  • 过采样策略带来的性能提升微乎其微,甚至在某些情况下导致性能下降,表明在跨领域设置中,成对排序的样本增强存在局限性。
  • 欠采样策略结果参差不齐:在部分数据集(如SPE_A)上性能有所提升,但在其他数据集上则不稳定或下降,凸显了数据稀缺在不同领域中的特定挑战。
  • 本研究揭示,尽管跨领域学习缓解了标注瓶颈,但性能差距依然显著,表明需要进一步研究更优的数据增强方法和领域不变表示学习。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。