Skip to main content
QUICK REVIEW

[論文レビュー] Predicting the popularity of online content

Gábor Szabó, Bernardo A. Huberman|ArXiv.org|Nov 4, 2008
Caching and Content Delivery参考文献 20被引用数 7
ひとこと要約

本論文では、YouTubeおよびDiggの初期アクセスデータを用いて、オンラインコンテンツの長期的インパクトを予測する手法を提案する。視聴数および投票の蓄積ダイナミクスをモデル化することで、高い精度が達成された。YouTube動画については10日間のデータで30日後の人気を予測可能であり、Diggのストーリーについては初期2時間のデータで人気を予測可能であり、コンテンツの衰退パターンの違いに起因する。

ABSTRACT

We present a method for accurately predicting the long time popularity of online content from early measurements of user access. Using two content sharing portals, Youtube and Digg, we show that by modeling the accrual of views and votes on content offered by these services we can predict the long-term dynamics of individual submissions from initial data. In the case of Digg, measuring access to given stories during the first two hours allows us to forecast their popularity 30 days ahead with remarkable accuracy, while downloads of Youtube videos need to be followed for 10 days to attain the same performance. The differing time scales of the predictions are shown to be due to differences in how content is consumed on the two portals: Digg stories quickly become outdated, while Youtube videos are still found long after they are initially submitted to the portal. We show that predictions are more accurate for submissions for which attention decays quickly, whereas predictions for evergreen content will be prone to larger errors.

研究の動機と目的

  • ユーザー生成コンテンツの初期アクセスパターンに基づいて、長期的人気を予測する手法を開発すること。
  • YouTubeやDiggのようなプラットフォームにおける初期の人気トレンドが、長期的パフォーマンスを予測するのにどのように寄与するかを理解すること。
  • DiggのタイムリーなストーリーとYouTubeのエバーグリーン動画のような、異なるコンテンツ消費ダイナミクスを示すプラットフォーム間で、予測精度を比較すること。
  • コンテンツの衰退が予測の信頼性に与える影響を評価し、予測が最も正確になる条件を同定すること。

提案手法

  • 7,146本のYouTube動画およびDiggストーリーについて、長期にわたり毎日の視聴回数および投票(diggs)の時系列データを収集した。
  • 人気データに対数変換を適用して成長パターンを線形化し、ノイズを低減させ、線形モデルの適用を可能にした。
  • 変換済みの人気データに対して線形回帰を適用し、初期段階の測定値から将来の人気を予測した。
  • 初期の人気と後の人の人気の間の線形相関に基づいて、3つの予測モデルを評価し、最も優れた性能を示したモデルを選択した。
  • 予測不確実性の分散を低減するため、絶対誤差よりも相対誤差を用いた。特に分散が大きい予測に対して有効である。
  • 最大尤度推定法をモデルパラメータに適用した。これは、大量のデータが利用可能であり、その場合にベイズ推定と等価であるという理由から妥当である。

実験結果

リサーチクエスチョン

  • RQ1YouTubeおよびDiggにおける初期アクセスパターンを用いて、長期的人気を正確に予測できるか?
  • RQ2異なるコンテンツ衰退ダイナミクスを持つプラットフォーム間で、予測の時間スケールはどのように異なるか?
  • RQ3なぜ、注目が急速に消えるコンテンツ(例:Digg)の予測は、エバーグリーンコンテンツ(例:YouTube)よりも正確なのか?
  • RQ4絶対誤差と相対誤差の誤差指標の選択が、人気予測の信頼性にどのように影響するか?
  • RQ5初期アクセスデータのみを用いて人気を予測する場合、意味的または文脈的特徴を無視できる範囲はどの程度か?

主な発見

  • Diggストーリーの人気予測精度は、投稿後約2時間でピークに達し、10%の誤差で予測可能である。これは、コンテンツの陳腐化が速いためである。
  • YouTube動画については、10日間の視聴データが必要であり、10%の予測誤差に到達する。これは、衰退が遅く、関連性が長く続くためである。
  • 人気データの対数変換により、初期の人気と後の人の人気の間に強い線形相関が明らかになり、正確なモデリングが可能になった。
  • 絶対誤差で測定した場合、予測誤差は著しく分散が大きいが、相対誤差を用いることで分散が顕著に低減された。
  • 注目が急速に消えるコンテンツでは予測が最も正確であり、エバーグリーンコンテンツでは、露出期間が長く変動が大きいことから、予測誤差が大きくなる。
  • 本研究は、意味的またはコンテンツベースの特徴を一切無視しても、大規模なユーザーコミュニティにおいて、初期アクセスデータのみで非常に正確な人気予測が可能であることを確認した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。