Skip to main content
QUICK REVIEW

[论文解读] Analyzing Political Bias and Unfairness in News Articles at Different Levels of Granularity

Wei-Fan Chen, Khalid Al‐Khatib|arXiv (Cornell University)|Oct 20, 2020
Misinformation and Its Impacts参考文献 17被引用 4
一句话总结

本文提出了一种基于神经网络的方法,用于在多个文本粒度层次(词、句子、段落和语篇)上检测新闻文章中的政治偏见和不公平性。基于一个新收集的6,964篇标注文章的语料库,作者采用反向特征分析发现,偏见在文章末尾部分最为显著,其中负面情绪和现在时态语言是词级别上的关键指标;在检测不公平性方面表现更优(F1值为83.42%),而政治偏见的检测F1值为75.42%。

ABSTRACT

Media organizations bear great reponsibility because of their considerable influence on shaping beliefs and positions of our society. Any form of media can contain overly biased content, e.g., by reporting on political events in a selective or incomplete manner. A relevant question hence is whether and how such form of imbalanced news coverage can be exposed. The research presented in this paper addresses not only the automatic detection of bias but goes one step further in that it explores how political bias and unfairness are manifested linguistically. In this regard we utilize a new corpus of 6964 news articles with labels derived from adfontesmedia.com and develop a neural model for bias assessment. By analyzing this model on article excerpts, we find insightful bias patterns at different levels of text granularity, from single words to the whole article discourse.

研究动机与目标

  • 探究政治偏见与不公平性在从词到语篇等不同文本粒度层次上的语言表现形式。
  • 基于新构建的大规模标注语料库,开发一种稳健且可训练的分类器,用于检测新闻文章中的偏见与不公平性。
  • 揭示新闻文章中偏见的序列性模式,尤其关注偏见在文本结构中的累积位置与方式。
  • 通过无监督反向特征分析实现偏见检测模型的深层可解释性,该方法可在训练后应用,且适用于任意语义层次。
  • 为未来媒体偏见与新闻业公平性研究提供公开可用的高质量语料库。

提出的方法

  • 基于allsides.com和adfontesmedia.com的数据,构建了一个包含6,964篇新闻文章的新语料库,对主题、政治偏见和不公平性进行标注。
  • 训练一个循环神经网络(RNN)分类器,用于检测新闻文章中的政治偏见、不公平性及非客观性。
  • 应用反向特征分析,通过识别词、句子、段落和语篇层次上的显著文本片段,解释模型预测结果。
  • 使用LIWC(语言探究与词频分析)类别,将语言特征与偏见类型相关联,尤其关注情绪性与感知性语言。
  • 通过归一化得分可视化各文本片段的偏见强度,发现偏见峰值出现在文章最后四分之一处。
  • 采用无监督反向特征分析,提取类似注意力的重要性分数,无需重新训练模型或预先定义文本分割。

实验结果

研究问题

  • RQ1政治偏见与不公平性在从单个词汇到整个语篇等不同文本粒度层次上,如何通过语言表现出来?
  • RQ2哪些语言特征(如情绪性语言、现在时态焦点)与政治偏见和不公平性具有最强相关性?
  • RQ3在新闻文章的哪个部分——句子、段落或语篇层次——偏见最常达到峰值?
  • RQ4三种类型(政治偏见、不公平性、非客观性)的偏见序列模式有何不同?
  • RQ5反向特征分析是否能有效识别偏见热点,而无需依赖注意力机制或模型微调?

主要发现

  • RNN模型在非客观性检测上的F1值为75.42%,在不公平性检测上达到83.42%,在政治偏见检测上为75.42%,表明整体性能出色,尤其在不公平性检测方面表现突出。
  • 文章最后四分之一部分始终表现出最高的偏见强度,其中最后一段及最后句子的政治偏见与不公平性最为严重。
  • 在词级别上,负面情绪、愤怒和情感类别与政治偏见相关性最强,而“现在时态焦点”则最能指示不公平性。
  • 感知性词汇如“感觉”、“阴郁”和“描绘”与非客观性高度相关,表明主观语言与缺乏客观性之间存在关联。
  • 反向特征分析成功识别出句子与段落级别的偏见区域,且无需依赖注意力机制或模型微调。
  • 分析表明,不公平性比政治偏见更易检测,可能是因为前者具有更清晰的语言标记,如选择性事实陈述与单边框架。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。