Skip to main content
QUICK REVIEW

[論文レビュー] Selection Bias in News Coverage: Learning it, Fighting it

Dylan Bourgeois, Jérémie Rappaz|arXiv (Cornell University)|Apr 16, 2019
Media Influence and Politics参考文献 24被引用数 10
ひとこと要約

本稿では、イベントカバレッジデータからメディア・ソースの編集的好みの潜在的表現を学習することで、ニュース報道における選択バイアスをモデル化・緩和する、パーソナライズされた要因分解ベースの手法を提案する。多様性に配慮した目的関数を用いたソースの再ランク付けにより、報道の不平等性が軽減され(25件のソースについてジニ係数が0.79から0.74に低下)、高インパクトイベントの報道が維持される。これにより、報道の多様性を損なわず、報道の多様性を促進する。

ABSTRACT

News entities must select and filter the coverage they broadcast through their respective channels since the set of world events is too large to be treated exhaustively. The subjective nature of this filtering induces biases due to, among other things, resource constraints, editorial guidelines, ideological affinities, or even the fragmented nature of the information at a journalist's disposal. The magnitude and direction of these biases are, however, widely unknown. The absence of ground truth, the sheer size of the event space, or the lack of an exhaustive set of absolute features to measure make it difficult to observe the bias directly, to characterize the leaning's nature and to factor it out to ensure a neutral coverage of the news. In this work, we introduce a methodology to capture the latent structure of media's decision process on a large scale. Our contribution is multi-fold. First, we show media coverage to be predictable using personalization techniques, and evaluate our approach on a large set of events collected from the GDELT database. We then show that a personalized and parametrized approach not only exhibits higher accuracy in coverage prediction, but also provides an interpretable representation of the selection bias. Last, we propose a method able to select a set of sources by leveraging the latent representation. These selected sources provide a more diverse and egalitarian coverage, all while retaining the most actively covered events.

研究の動機と目的

  • ニュースメディアにおける選択バイアスを、メディア・ソースのイベント選択をイベント上での潜在的好みとみなす、好み学習問題としてモデル化すること。
  • 報道パターンに基づいて解釈可能な、データ駆動型のニュース・ソースコミュニティを同定することにより、地理的関係や企業関係といった隠れた構造的関係を明らかにすること。
  • 高インパクトイベントを保持しつつ、より多様で均等なニュース報道を実現する代表的ソースのサブセットを選択する手法を開発すること。
  • ジニ係数を用いて測定されるニュース注目度の不平等性を定量化・緩和することにより、主要なニュースイベントの取り上げを犠牲にせずに、報道の公平性を向上させること。
  • エコーシステムの縮小や少数のソースによる公衆認識の支配を低減することで、メディアの多様性を促進すること。

提案手法

  • 本手法は、ニュース報道をユーザー-アイテム相互作用行列としてモデル化し、ソースを「ユーザー」、イベントを「アイテム」とみなす。各エントリは報道頻度を示す。
  • 低次元の潜在的表現を学習するために、行列分解を適用し、メディア選択の背後にある好み構造を捉える。
  • 多様性パラメータβを用いたパーソナライズド・ランク付けアプローチにより、ソース選択を再順序付けし、報道の平等性とトップイベントの保持のバランスを取る。
  • ジニ係数(不平等性)を最小化し、選択されたソース集合に含まれる高頻度報道イベントの割合を最大化する再ランク付け目的関数を用いる。
  • 潜在空間により、外部メタデータがなくても、地理的クラスタリングやサテライトネットワークといったソース関係の解釈が可能になる。
  • 大規模なGDELTベースのグローバルニュースイベントおよびソースデータセットを用いて評価され、予測精度と公平性指標を用いて性能が測定される。

実験結果

リサーチクエスチョン

  • RQ1観察された報道データのみを用いて、ニュース報道におけるメディア選択バイアスを好み学習問題としてモデル化できるか?
  • RQ2報道パターンの単独からの分析で、ニュース・ソース間の潜在的構造的関係(例:地理的関係、企業関係)を特定できるか?
  • RQ3学習された表現に基づく再ランク付け戦略が、ニュース報道の多様性と平等性をどの程度向上できるか?
  • RQ4提案手法は、報道の公平性と高インパクトイベントの保持のトレードオフをどのようにバランスさせるか?
  • RQ5学習された表現は、企業関係やサテライトネットワークといった明白でないメディア関係を特定できるか?

主な発見

  • 提案手法は、ベースラインモデルに比べて、メディア報道の予測精度が向上しており、パーソナライズド要因分解を用いることで、ニュース選択が予測可能であることを示している。
  • 学習された潜在的表現により、外部情報がなくても、地理的依存関係や同じメディア内での関係性を含む、解釈可能な一貫性のあるソースコミュニティが明らかになった。
  • 多様性パラメータβ = 0.5を用いることで、25件のソース選択において、報道の不平等性ジニ係数が0.79から0.74に低下し、注目度の不平等性が軽減された。
  • 100件のソースを選択した場合、ジニ係数は0.78から0.68に低下し、均等な報道の質の向上が顕著に示された。
  • カバーされるユニークなイベント数が減少しても、再ランク付けされたソース集合は、ランダム選択や人気度ベース選択に比べ、より多くのトップインパクトイベントを保持していた。
  • 本手法は、放送サテライトネットワークや企業ネットワークといった、非自明な関係を効果的に同定でき、メディアエコシステムの透明性を高めた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。