Skip to main content
QUICK REVIEW

[论文解读] Experiments in Detecting Persuasion Techniques in the News

Seunghak Yu, Giovanni Da San Martino|arXiv (Cornell University)|Nov 15, 2019
Misinformation and Its Impacts参考文献 11被引用 16
一句话总结

本文提出了一项细粒度任务,用于检测新闻文章中的特定宣传技巧,引入了一种多粒度神经网络,通过联合进行句子级别和片段级别的分类,优于基于 BERT 的基线模型。该模型在片段级别分类上实现了 22.58 的 F1 分数,在句子级别分类上实现了 60.71 的 F1 分数,提升了检测媒体偏见的可解释性。

ABSTRACT

Many recent political events, like the 2016 US Presidential elections or the 2018 Brazilian elections have raised the attention of institutions and of the general public on the role of Internet and social media in influencing the outcome of these events. We argue that a safe democracy is one in which citizens have tools to make them aware of propaganda campaigns. We propose a novel task: performing fine-grained analysis of texts by detecting all fragments that contain propaganda techniques as well as their type. We further design a novel multi-granularity neural network, and we show that it outperforms several strong BERT-based baselines.

研究动机与目标

  • 为解决粗粒度宣传检测的局限性,聚焦于在片段级别识别特定的宣传技巧。
  • 开发一种更具可解释性的 AI 系统,能够向用户说明为何一篇文章被标记为具有宣传性。
  • 通过在片段级别使用高质量、专业标注,减少远程监督带来的噪声。
  • 通过训练用户识别新闻内容中微妙的说服性技巧,提升媒体素养。
  • 创建一个基准数据集,涵盖 451 篇新闻文章中的 18 种不同宣传技巧。

提出的方法

  • 提出一种新颖的多粒度神经网络,利用共享的 BERT 上下文嵌入,联合执行句子级别分类(SLC)和片段级别分类(FLC)。
  • 引入一种门控机制,控制从句子级别预测到片段级别分类的信息流,通过过滤非宣传性句子提升精度。
  • 采用混合损失函数,结合 SLC 的二元交叉熵和 FLC 的多类别交叉熵,通过超参数 α 平衡任务权重。
  • 使用字符级别重叠函数 C(s,t,h) 计算片段预测的部分得分,支持在预测跨度不完全匹配时的稳健评估。
  • 应用 ReLU 和 sigmoid 门控机制,控制从句子级别到标记级别分类的信息流动,消融实验表明 sigmoid 表现更优。
  • 在经过筛选的 451 篇新闻文章数据集上微调 BERT,涵盖 18 种类型共 7,485 个宣传技巧实例,采用三重训练/验证/测试划分。

实验结果

研究问题

  • RQ1与标准的基于 BERT 的模型相比,多粒度神经网络是否能提升对新闻文章中特定宣传技巧的检测效果?
  • RQ2利用句子级别预测作为片段级别分类的门控机制,是否能提升识别宣传片段的精确率和召回率?
  • RQ3在句子级别和片段级别任务上联合训练,能在多大程度上提升整体性能和可解释性?
  • RQ4所提出的带有部分重叠得分的评估指标,在衡量细粒度宣传检测模型性能方面是否有效?
  • RQ5尽管存在类别不平衡,该模型是否能泛化以检测稀有宣传技巧,如稻草人谬误或红鲱鱼?

主要发现

  • 采用 sigmoid 门控的多粒度模型在片段级别分类(FLC)任务上取得了 22.58 的 F1 分数,优于所有基于 BERT 的基线模型。
  • 由于利用了标记级别预测提升召回率,该模型在句子级别分类(SLC)上的 F1 分数相比 BERT 基线提升了 3.24 个百分点(达到 60.71)。
  • BERT-Granularity 模型通过将句子级别输出用作片段级别分类的过滤器,在 FLC 上取得小幅提升(F1: 21.80)。
  • ReLU 门控变体的精确率更高(23.98),但召回率更低(20.33),相比 Sigmoid 门控(F1: 24.42),表明 Sigmoid 在平衡性上更优。
  • 该模型在稀有技巧(如稻草人谬误,仅 15 个实例)上的表现有限,凸显了低资源宣传类型面临的挑战。
  • 采用加权损失的联合训练策略(SLC 的 α=0.9,FLC 的 α=0.1)有效缓解了类别不平衡问题,提升了整体泛化能力。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。