[論文レビュー] NeMig -- A Bilingual News Collection and Knowledge Graph about Migration
NeMigは、移住をテーマにした独英両語のニュースコレクションおよび知識グラフを提供する。このデータセットは、感情の極端化、メディアの政治的傾向、サブトピック、およびWikidataによる固有化処理済みのエンティティを含む。匿名化されたユーザーの属性データ(社会的・人口統計的および政治的属性)を含み、精度評価を超えたレコメンデーションバイアス、フィルターバブル、およびクロスリンガルニュースキュレーション効果の分析を可能にする。
News recommendation plays a critical role in shaping the public's worldviews through the way in which it filters and disseminates information about different topics. Given the crucial impact that media plays in opinion formation, especially for sensitive topics, understanding the effects of personalized recommendation beyond accuracy has become essential in today's digital society. In this work, we present NeMig, a bilingual news collection on the topic of migration, and corresponding rich user data. In comparison to existing news recommendation datasets, which comprise a large variety of monolingual news, NeMig covers articles on a single controversial topic, published in both Germany and the US. We annotate the sentiment polarization of the articles and the political leanings of the media outlets, in addition to extracting subtopics and named entities disambiguated through Wikidata. These features can be used to analyze the effects of algorithmic news curation beyond accuracy-based performance, such as recommender biases and the creation of filter bubbles. We construct domain-specific knowledge graphs from the news text and metadata, thus encoding knowledge-level connections between articles. Importantly, while existing datasets include only click behavior, we collect user socio-demographic and political information in addition to explicit click feedback. We demonstrate the utility of NeMig through experiments on the tasks of news recommenders benchmarking, analysis of biases in recommenders, and news trends analysis. NeMig aims to provide a useful resource for the news recommendation community and to foster interdisciplinary research into the multidimensional effects of algorithmic news curation.
研究の動機と目的
- 移住のような論争の多いトピックに特化した多言語対応で、政治的および感情的属性が付与されたニュースデータセットが不足しているという問題に対処する。
- 精度評価を超えたアルゴリズム的レコメンデーションバイアスおよびフィルターバブル形成の研究を可能にする。
- メディアキュレーションが政治的極端化や世論に与える影響を分析するための学際的研究リソースを提供する。
- 構造的でWikidata強化済みの知識グラフを通じて、知識を活用するレコメンデーションシステムの開発を支援する。
- 明示的なクリックフィードバックと併せた包括的なユーザープロファイルを提供することで、合成ユーザーデータの生成を促進する。
提案手法
- 政治的傾向の広がりをカバーする多様なメディア出先から、7,000件のドイツ語および10,000件の米国ニュース記事を収集した。
- 専門家によるラベル付けおよび既存の分類スキームを用いて、記事の感情の極端化およびメディア出先の政治的傾向をアノテートした。
- サブトピックおよび固有名を抽出し、意味的一致性を保つためにWikidataを用いて固有化処理を行った。
- ニューステキスト、メタデータ、およびWikidataからの最大2ホップの近接エンティティを統合することで、分野特化型の知識グラフ(NeMigKG)を構築した。
- 複数のNeMigKGバージョンを用いてTransDで事前学習したエンティティ埋め込みを生成し、レコメンデーション性能に与える影響を評価した。
- 各言語で3,000人のユーザー分の匿名化されたユーザーデータ(人口統計的属性、政治的態度、パーソナリティ特性、明示的なクリックフィードバック)を収集した。

実験結果
リサーチクエスチョン
- RQ1ニュース記事に政治的傾向と感情の極端化を組み込むと、レコメンデーションシステムのパフォーマンスおよび多様性にどのような影響を与えるか?
- RQ2Wikidataの近接エンティティを知識グラフに拡張することで、レコメンデーションの正確性およびアスペクトベースの多様性はどの程度向上するか?
- RQ3政治的傾向が異なるメディア出先は、時間経過とともに同じ移住関連エンティティをどの程度異なる頻度で報じているか?
- RQ4ユーザーの社会的・人口統計的および政治的属性データは、ニュースレコメンデーションシステムにおけるフィルターバブル効果の検出および分析にどの程度役立つか?
- RQ5ドイツおよび米国のメディアにおいて、政治的立場に応じたエンティティカバレッジの時間的傾向はどのようなものか?
主な発見
- NeMigKGに政治的傾向、感情の極端化、サブトピック情報を追加することで、正確性に著しい影響を与えることなく、アスペクトベースの多様性が向上した。
- Wikidataからの1ホップの近接エンティティをNeMigKGに拡張することで、レコメンデーションパフォーマンスが向上したが、2ホップの近接エンティティを追加するとパフォーマンスが低下した。これは、小さなデータセットでは知識の過剰な充填が問題となることを示している。
- ドイツ語メディアで最も頻出する上位20のエンティティは、主に中心右および中心メディアで報じられており、アンジェラ・メルケルや『ディ・リンク』といった例外的なエンティティは右派メディアでより頻繁に取り上げられていた。
- 米国メディアにおいては、左派メディアが最も一般的なエンティティを中心または右派メディアよりも頻繁に報じていなかった。
- 時間的分析から、ドイツ語メディアにおけるエンティティカバレッジは連邦選挙や欧州選挙、シリア北部におけるトルコ軍の軍事行動といった主要な政治的出来事と相関していた。
- ユーザーの人口統計的および政治的属性データの統合により、ユーザー固有のバイアスパターンの検出が可能となり、政治的極端化に及ぼすパーソナライズドレコメンデーションの影響の研究が支援された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。