Skip to main content
QUICK REVIEW

[論文レビュー] Aggregating Content and Network Information to Curate Twitter User Lists

Derek Greene, Gavin Sheridan|arXiv (Cornell University)|Jun 8, 2012
Complex Network Analysis Techniques参考文献 10被引用数 6
ひとこと要約

本稿では、コンテンツベースとネットワークベースの推薦基準を統合するSVDに基づく集約手法を提案し、Twitterユーザーリストのキュレーションを改善する。多様な視点(共リスト化されたユーザ、メンション、ツイート内容など)を統合することで、特にデータが乏しい状況下でも、単一の基準に依存するよりもはるかに強固で正確な推薦が得られることを示している。

ABSTRACT

Twitter introduced user lists in late 2009, allowing users to be grouped according to meaningful topics or themes. Lists have since been adopted by media outlets as a means of organising content around news stories. Thus the curation of these lists is important - they should contain the key information gatekeepers and present a balanced perspective on a story. Here we address this list curation process from a recommender systems perspective. We propose a variety of criteria for generating user list recommendations, based on content analysis, network analysis, and the "crowdsourcing" of existing user lists. We demonstrate that these types of criteria are often only successful for datasets with certain characteristics. To resolve this issue, we propose the aggregation of these different "views" of a news story on Twitter to produce more accurate user recommendations to support the curation process.

研究の動機と目的

  • ニュース報道のためのTwitterユーザーリストを手作業でキュレートすることは時間のかかる作業であり、不完全またはバイアスのかかった表現が生じがちであるという課題に対処すること。
  • トピックに特化したTwitterリストにユーザを追加する際、コンテンツベースまたはネットワークベースの基準を独立して用いることの限界を調査すること。
  • 複数の視点(コンテンツ、ネットワーク、クラウドソーシングされたリストデータ)を統合した包括的な推薦フレームワークを構築し、キュレーションの正確性を向上させること。
  • Storyfulのメディア専門家が提供する真値を用いて、米国政治イベントに関連する多様なTwitterデータセットにおいて、集約された推薦の有効性を評価すること。

提案手法

  • 報道機関としての信頼性の高いユーザの初期シードリストを、特定のニューストピックに関連する追加ユーザの推薦の文脈として用いる。
  • 5つの異なる推薦基準を適用:ネットワークベース(フォローされている、メンションされた、共リスト化された)とコンテンツベース(ツイート、リスト名)、それぞれが候補者をランク付けしたリストを出力する。
  • 10個の米国政治関連ニュースデータセットにおいて、各基準が真値のシードユーザとどの程度整合性を持つのかを評価するため、結束分析(cohesion analysis)を実施する。
  • 上位5つの基準をSVDに基づくランク集約により統合し、より強固な1つの推薦リストを生成する。
  • 交差検証を用い、複数のkランク(k=10, 20, 30, 40, 50)における正確性(precision)と再現率(recall)の指標で、複数のデータセット全体での性能を評価する。
  • 全実験において、各基準の順位付け(1位、2位、3位)を比較することで、集約結果の性能を評価する。

実験結果

リサーチクエスチョン

  • RQ1真値が利用可能な状況下で、コンテンツベースとネットワークベースの基準が、それぞれTwitterリストのユーザ推薦においてどの程度の性能を示すか?
  • RQ2データの可用性に差がある多様なTwitterデータセットにおいて、異なる推薦基準の有効性にどのような差が生じるか?
  • RQ3ランク集約を用いて複数の基準を統合することで、個々の基準に比べて推薦の強度と正確性が向上するか?
  • RQ4SVDに基づく集約手法は、複数のデータセットおよびkランクにおいて、最良の個別基準に比べて正確性と再現率の観点でどの程度の性能を示すか?

主な発見

  • SVDに基づく集約手法は、全データセットおよびkランクにおいて、正確性評価の48%、再現率評価の46%で1位の成績を収めた。
  • 集約手法は正確性評価の92%、再現率評価の88%で上位3位以内に入り、個々の基準を顕著に上回った。
  • 最も競争力のある単一基準「mentioned-by」でさえ、全実験の50%で上位3位以内に入ったにとどまり、集約の価値が顕著に示された。
  • コンテンツベースの基準(例:"tweets (200)" と "list names")は単独では低く、1位・2位の順位が極めて少なかったため、信頼性が低いことが示された。
  • ネットワークベースの基準(例:"followed-by" と "co-listed")は中程度の性能を示したが、依然として集約手法に劣った。
  • 結束分析の結果、どの基準も全データセットで真値と一貫して一致するとは限らず、集約の必要性が裏付けられた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。