Skip to main content
QUICK REVIEW

[论文解读] In Plain Sight: Media Bias Through the Lens of Factual Reporting

Lisa Fan, Marshall White|arXiv (Cornell University)|Sep 5, 2019
Media Influence and Politics参考文献 27被引用 5
一句话总结

本文提出了BASIL,一个包含300篇新闻文章的新数据集,这些文章同时标注了词汇性偏见和信息性偏见,表明在媒体中,信息性偏见——即用于微妙影响读者观点的事实性内容——比词汇性偏见更为普遍。通过在BASIL上微调BERT模型,本研究表明,识别信息性偏见仍然是一个重大挑战,凸显了在整篇文章范围内进行上下文建模以及多源对比的必要性。

ABSTRACT

The increasing prevalence of political bias in news media calls for greater public awareness of it, as well as robust methods for its detection. While prior work in NLP has primarily focused on the lexical bias captured by linguistic attributes such as word choice and syntax, other types of bias stem from the actual content selected for inclusion in the text. In this work, we investigate the effects of informational bias: factual content that can nevertheless be deployed to sway reader opinion. We first produce a new dataset, BASIL, of 300 news articles annotated with 1,727 bias spans and find evidence that informational bias appears in news articles more frequently than lexical bias. We further study our annotations to observe how informational bias surfaces in news articles by different media outlets. Lastly, a baseline model for informational bias prediction is presented by fine-tuning BERT on our labeled data, indicating the challenges of the task and future directions.

研究动机与目标

  • 探究新闻媒体中除词汇性偏见外的信息性偏见——即用于微妙影响读者观点的事实性内容。
  • 创建一个新数据集BASIL,包含300篇新闻文章,对其中的词汇性偏见和信息性偏见片段进行细粒度标注。
  • 使用三重设计(每个事件对应三家媒体)比较不同政治意识形态媒体在报道相同事件时的偏见模式。
  • 通过基于规则的方法和微调后的BERT模型,对信息性偏见检测的难度进行基准测试。
  • 识别未来研究方向,特别是利用上下文信息和多源信息进行偏见检测。

提出的方法

  • 从100个事件三重组(每事件三家媒体)中选取300篇新闻文章,涵盖不同政治意识形态,对1,727个偏见片段进行词汇性偏见和信息性偏见的标注。
  • 设计多标签标注方案,以区分词汇性偏见(用词选择、句法结构)和信息性偏见(上下文框架、选择性事实呈现)。
  • 使用BERT-base(区分大小写)对句子级分类和标记级序列标注任务进行微调,以实现偏见预测。
  • 采用10折交叉验证进行模型训练与评估,句子分类和序列标注任务分别设置独立的划分。
  • 采用流水线方法:首先使用BERT判断句子是否包含偏见,然后在这些句子中对单个标记进行标注。
  • 使用基于TF-IDF的句子选择作为基线方法,通过与文章整体主题的偏离程度识别潜在偏见句子。

实验结果

研究问题

  • RQ1在不同媒体中,信息性偏见相较于词汇性偏见在新闻媒体中出现的频率如何?
  • RQ2具有不同政治意识形态的媒体在报道同一事件时,如何编码信息性偏见?
  • RQ3与词汇性偏见相比,基于BERT的模型在多大程度上能够检测信息性偏见?其主要挑战是什么?
  • RQ4上下文——尤其是整篇文章的上下文或多源报道——如何影响信息性偏见的检测?
  • RQ5当前基于规则的方法和神经网络方法在识别细微、上下文依赖的偏见方面存在哪些局限性?

主要发现

  • 在新闻文章中,信息性偏见比词汇性偏见更为普遍,研究中所有三家媒体均表现出更高的信息性偏见比例。
  • 信息性偏见在文章中分布均匀,而词汇性偏见往往集中在文本开头。
  • BERT微调在信息性偏见检测上的F1得分为18.71,词汇性偏见为25.98,表明信息性偏见显著更难检测。
  • 在信息性偏见预测中表现最佳的BERT模型,其精确率为25.56,召回率为14.78,F1得分为18.71,尽管采用了上下文建模,但性能仍有限。
  • 基于TF-IDF的规则基线方法在识别低相似度句子方面表现相对良好,表明与文章核心主题的偏离是信息性偏见的强信号。
  • 标记级序列标注结果表明,BERT模型在识别信息性偏见片段方面表现更差,其召回率和F1值均低于词汇性偏见标注。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。