Skip to main content
QUICK REVIEW

[論文レビュー] Barbara Made the News: Mining the Behavior of Crowds for Time-Aware Learning to Rank

Flávio Martins, João Magalhães|arXiv (Cornell University)|Feb 9, 2016
Advanced Text Analysis Techniques参考文献 31被引用数 11
ひとこと要約

本稿では、Twitter、Wikipedia、ニュース、クエリログといった複数のWebソースから集団行動を抽出することで、マイクロブログ検索の関連順序付けを向上させる時間に配慮した学習-ランクフレームワークRMTSを提案する。多様なソースからの時間的信号を統合し、それを学習-ランクモデルに組み込むことで、TREC 2013および2014マイクロブログトラックデータセットにおいて、語彙的モデルより13.2%、強力なLTRベースラインより6.2%の相対的改善を達成した。

ABSTRACT

In Twitter, and other microblogging services, the generation of new content by the crowd is often biased towards immediacy: what is happening now. Prompted by the propagation of commentary and information through multiple mediums, users on the Web interact with and produce new posts about newsworthy topics and give rise to trending topics. This paper proposes to leverage on the behavioral dynamics of users to estimate the most relevant time periods for a topic. Our hypothesis stems from the fact that when a real-world event occurs it usually has peak times on the Web: a higher volume of tweets, new visits and edits to related Wikipedia articles, and news published about the event. In this paper, we propose a novel time-aware ranking model that leverages on multiple sources of crowd signals. Our approach builds on two major novelties. First, a unifying approach that given query q, mines and represents temporal evidence from multiple sources of crowd signals. This allows us to predict the temporal relevance of documents for query q. Second, a principled retrieval model that integrates temporal signals in a learning to rank framework, to rank results according to the predicted temporal relevance. Evaluation on the TREC 2013 and 2014 Microblog track datasets demonstrates that the proposed model achieves a relative improvement of 13.2% over lexical retrieval models and 6.2% over a learning to rank baseline.

研究の動機と目的

  • 時間的関連性を組み込むことにより、短いイベント駆動型マイクロブログ投稿の順序付けに限界をもつ標準的なリtrievalモデルの課題に対処する。
  • Twitter や Wikipedia などの単一のソースに依存する時間的信号のバイアスを克服するため、複数のクラウドソースからのデータストリームを統合する。
  • 多様なWebソースからの異種時間的信号を統合的に表現する、強固で統一されたフレームワークを構築し、クエリに最も関連する時間帯を予測する。
  • 社会的メディア、ニュース、Wikipediaにおけるユーザーの集団的行動を原理的で学習-ランク設定でモデル化することで、時間的に敏感なクエリの順序付けパフォーマンスを向上させる。

提案手法

  • Twitter(投稿時刻)、Wikipedia(ページビューと編集履歴)、ニュース記事(公開時刻)、クエリログ(クリックスルーパatters)の4つのソースから時間的信号を抽出する。
  • 各ソースの時間的証拠を、信号強度(例:閲覧数、編集頻度)から導出された関連性重みを伴う重み付き時系列として表現する。
  • すべてのソースからの正規化済み時系列を統合して各文書ごとに統一された時間的特徴ベクトルを構築し、複数ソース間の時間的整合性を実現する。
  • MAPおよびP30指標の最適化を目的として、勾配ブースティングツリーを用いて統一された時間的特徴を学習-ランクフレームワーク(LTR)に統合する。
  • 特徴選択とアブレーションを適用し、各ソースの寄与度を評価するとともに、欠損データに対する耐性を検証する。
  • BM25および語彙的LTRモデルを含むベースラインとの性能向上を統計的有意性(p < 0.01)で検証する。

実験結果

リサーチクエスチョン

  • RQ1多様なWebソースからの複数のクラウドソース時間的信号を統合することで、マイクロブログ検索における時間に配慮した順序付けを向上させることができるか?
  • RQ2ニュース、Wikipedia、Twitterなどの異なるソースは、クエリに最も関連する時間帯を特定するために、どのように寄与するか?
  • RQ3単一の時間的データソースが欠落した場合に、提案されたモデルがどの程度耐性を示すか?
  • RQ4異種時間的信号の統一的表現は、単一ソースアプローチよりも一般化性とパフォーマンスに優れているか?
  • RQ5初期のTwitter結果に明確な時間的パターンがない場合、ニュースやWikipediaなどの外部ソースからの時間的信号は、リtrievalを改善できるか?

主な発見

  • RMTSモデルは、BM25およびディリクレット平滑化を施した言語モデルに対して、MAPで13.2%の相対的改善を達成し、統計的有意性(p < 0.01)を示した。
  • RMTSは、語彙的およびドメイン特徴を含む強力な学習-ランクベースラインよりも6.2%のパフォーマンス向上を示し、これも統計的有意性を伴った。
  • ニュースソースが最も顕著に寄与しており、これを除外するとMAPで最大2.74%の低下が生じ、時間的信号検出におけるその重要性を示している。
  • モデルは高い耐性を示した:任意の1つのソースを除外しても、パフォーマンス低下はわずかにとどまり(MAP最大2.74%)、欠損または故障したデータに対しても耐性があることを示している。
  • Twitter以外の少なくとも1つの外部ソースを含めることで、大多数のクエリでパフォーマンスが向上した。これは、複数ソース時間的証拠の価値を確認するものである。
  • 統一された時間的特徴表現により、異種信号の効果的な統合が可能となり、特にWikipediaのページビューと編集履歴がイベント検出に特に有効であることが判明した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。