[論文レビュー] "Don't quote me on that": Finding Mixtures of Sources in News Articles
本稿では、所属機関と役割に基づいて分類される複数のソースタイプの混合を特定する確率的グラフィカルモデルを提案する。専門家による評価において、ソースタイプの推論精度は80%に達した。本研究は、ジャーナリストがソースを選定する戦略的プロセスをモデル化することで、コンピュータ支援ジャーナリズムを前進させ、メディア報道におけるソースギャップの検出やトレンド分析を改善する。
Journalists publish statements provided by people, or extit{sources} to contextualize current events, help voters make informed decisions, and hold powerful individuals accountable. In this work, we construct an ontological labeling system for sources based on each source's extit{affiliation} and extit{role}. We build a probabilistic model to infer these attributes for named sources and to describe news articles as mixtures of these sources. Our model outperforms existing mixture modeling and co-clustering approaches and correctly infers source-type in 80\% of expert-evaluated trials. Such work can facilitate research in downstream tasks like opinion and argumentation mining, representing a first step towards machine-in-the-loop extit{computational journalism} systems.
研究の動機と目的
- 所属機関と役割に基づいてニュースソースの構造的オントロジーを構築し、ジャーナリズムにおけるその使用をより良く理解すること。
- ニュース記事を、ジャーナリストのソーシング戦略を反映するソースタイプの確率的混合としてモデル化すること。
- 従来の混合モデルおよび共同クラスタリング手法を上回るソースタイプ予測の精度を向上させること。
- 意見抽出、議論分析、コンピュータ支援ジャーナリズムツールにおける後続の応用を可能にすること。
- 時間的経過とニュースジャンルにわたるソーシング実践における編集的トレンドを解明すること。
提案手法
- 著者らは、25種類のソースタイプを含むソースオントロジーを定義し、所属機関(例:政府、NGO、学術機関)と役割(例:意思決定者、専門家、被害者)を統合する。
- 記事タイプと関連する語彙に基づいてソースタイプを推論する確率的グラフィカルモデルを構築する。
- 各ソースタイプのトピック関連性を特定するためにPMI(ポイントワイズ相互情報量)を用い、言語的特徴とソース役割を結びつける。
- 各記事をソースタイプの分布として表現する混合モデルアプローチを採用し、専門家がアノテートしたデータを用いた教師あり学習によりモデルを学習する。
- 専門家がアノテートしたテストデータセットを用いてモデルを評価し、ソースタイプ分類の予測精度を測定する。
- 異なるニュースジャンルが異なるソース混合を好むことを認識し、ドキュメントタイプの事前分布を導入してソースタイプ推論を向上させる。
実験結果
リサーチクエスチョン
- RQ1所属機関と役割を用いて、ニュース記事内のソースを体系的に分類することは可能か?
- RQ2記事の内容とジャンルに基づいて、確率的モデルがその記事内のソースタイプの混合をどの程度正確に予測できるか?
- RQ3災害報道、分析記事、政治報道などの異なるタイプのニュース記事において、ソーシングパターンはどのように異なるか?
- RQ4時間的経過に伴いソース使用にどのようなトレンドが見られ、それらはメディアアクセスの変化や制度的透明性の向上とどのように関連しているか?
- RQ5このモデルは、ジャーナリストの下書きにおいて欠落している、または代表されていないソースタイプを特定するのに役立つだろうか?
主な発見
- 専門家による評価試験において、モデルは80%の精度でソースタイプを予測し、従来の混合モデルおよび共同クラスタリングベースラインを顕著に上回った。
- 1999年から2002年の間に、ニューヨーク・タイムズのフェローページ記事では、上級政府関係者を含む割合が減少し、学術専門家が増加していた。これは、政府ソースへのアクセスが制限された可能性を示唆している。
- ドキュメントタイプはソースタイプの混合に強く影響を与える。例えば、「災害報道」(ドキュメントタイプ3)では政府意思決定者や被害者弁護士の割合が高く、一方「分析記事」(ドキュメントタイプ16)では企業関係者や学術専門家が強調されている。
- ソースタイプは明確な言語的トピックに関連している。例えば、「学術専門家」ソースは「研究」「調査」「病院」などの語と関連づけられ、一方「企業意思決定者」は「働く」「考える」「追加する」などの語と関連している。
- モデルは、編集的ソーシングのルールを明らかにした。例えば、政治的報道では「証人(一般)」の使用が増加しており、公式発表では「政府報道官」の使用が顕著に増加している。
- 本システムは、下書きにおけるソースギャップを検出でき、マシン・イン・ザ・ループジャーナリズムツールにおける実用的利点を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。