Skip to main content
QUICK REVIEW

[論文レビュー] In Plain Sight: Media Bias Through the Lens of Factual Reporting

Lisa Fan, Marshall White|arXiv (Cornell University)|Sep 5, 2019
Media Influence and Politics参考文献 27被引用数 5
ひとこと要約

本稿では、語彙的バイアスおよび情報的バイアスの両方についてアノテートされた300件のニュース記事から構成される新しいデータセットBASILを紹介する。この研究では、事実を巧みに用いて読者の意見をわずかに誘導する情報的バイアスが、メディアにおいて語彙的バイアスよりも顕著であることが示された。BASIL上でBERTを微調整した結果、情報的バイアスの検出は依然として大きな課題であることが明らかになり、全記事の文脈的モデリングおよび複数出典の比較が不可欠であることが強調された。

ABSTRACT

The increasing prevalence of political bias in news media calls for greater public awareness of it, as well as robust methods for its detection. While prior work in NLP has primarily focused on the lexical bias captured by linguistic attributes such as word choice and syntax, other types of bias stem from the actual content selected for inclusion in the text. In this work, we investigate the effects of informational bias: factual content that can nevertheless be deployed to sway reader opinion. We first produce a new dataset, BASIL, of 300 news articles annotated with 1,727 bias spans and find evidence that informational bias appears in news articles more frequently than lexical bias. We further study our annotations to observe how informational bias surfaces in news articles by different media outlets. Lastly, a baseline model for informational bias prediction is presented by fine-tuning BERT on our labeled data, indicating the challenges of the task and future directions.

研究の動機と目的

  • 語彙的バイアスを超えて、読者の意見をわずかに誘導するために事実を用いる情報的バイアス——ニュースメディアにおけるこのバイアスを調査すること。
  • 語彙的バイアスおよび情報的バイアスの両方についてアノテートされた、細分化された新しいデータセットBASILを構築すること(300件のニュース記事)。
  • 政治的イデオロギーが異なるメディア出典間でバイアスのパターンを比較すること(1イベントごとに3つの出典を用いたトリプレット設計)。
  • ルールベース手法および微調整済みBERTモデルを用いて、情報的バイアス検出の難易度をベンチマークすること。
  • 文脈的および複数出典情報の活用を念頭に置いた、今後のバイアス検出研究の方向性を同定すること。

提案手法

  • 政治的イデオロギーが異なる複数のメディアから100件のイベント・トリプレット(1イベントあたり3つの出典)を選び、全300件のニュース記事を対象に、語彙的バイアスおよび情報的バイアスの両方について1,727件のバイアススパンをアノテートした。
  • 語彙的バイアス(語彙の選択、構文)と情報的バイアス(文脈的なフレーミング、事実の選択的提示)を区別できるマルチラベルアノテーションスキーマを設計した。
  • バイアス予測のため、文レベル分類およびトークンレベルのシーケンスタグギングの両タスクに、BERT-base(大文字)を微調整して使用した。
  • モデルの訓練および評価には10分割交差検証を適用し、文分類とシーケンスタグギングの両タスクで別々の分割を実施した。
  • パイプラインアプローチを採用:まずBERTを用いて文をバイアスありと分類し、その後その文内の個々のトークンをタグ付けした。
  • TF-IDFに基づく文選択をベースラインとして採用し、記事全体の主題から逸脱する内容の文を、潜在的なバイアス文として特定した。

実験結果

リサーチクエスチョン

  • RQ1異なるメディア出典において、語彙的バイアスと比較して情報的バイアスはどの程度頻発しているか?
  • RQ2政治的イデオロギーが異なるメディア出典は、同じ出来事の報道において情報的バイアスをどのように表現しているか?
  • RQ3BERTベースのモデルは語彙的バイアスと比較して、情報的バイアスをどの程度検出できるか。主な課題は何か?
  • RQ4文脈(特に全記事の文脈または複数出典の報道比較)は、情報的バイアスの検出にどのように影響するか?
  • RQ5現在のルールベースおよびニューラル手法には、どのような限界があり、文脈依存の微細なバイアスを同定することが難しいか?

主な発見

  • 情報的バイアスは語彙的バイアスよりもニュース記事において顕著であり、本研究に含まれる3つのメディア出典すべてで情報的バイアスの発生率が高かった。
  • 情報的バイアスは記事全体に均等に分布している一方、語彙的バイアスは記事の冒頭に集中しやすい傾向を示した。
  • BERTの微調整により、情報的バイアス検出のF1スコアは18.71、語彙的バイアス検出では25.98を記録した。これにより、情報的バイアスは顕著に検出が困難であることが示された。
  • 情報的バイアス予測で最高の性能を示したBERTモデルは、精度25.56、再現率14.78、F1スコア18.71を達成した。文脈モデリングを活用しても限界があることが示された。
  • TF-IDFを用いたルールベースのベースラインは、記事の主題から逸脱する文を特定する手法として相対的に優れた性能を示した。これは、主題からの逸脱が情報的バイアスの強力な兆候である可能性を示唆している。
  • トークンレベルのシーケンスタグギングでは、BERTモデルが情報的バイアスのスパンを同定する際、語彙的バイアスタグギングと比較して再現率およびF1スコアが低く、同定が特に困難であることが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。