[論文レビュー] To Post or Not to Post: Using Online Trends to Predict Popularity of Offline Content
本稿では、話題の人気度の時系列予測と、最近公開された類似記事との類似度を活用することで、出版前におけるニュース記事のオフライン人気を予測する新規手法を提案する。類似記事の観測済みアクセスパターンと予測された話題の流入量を組み合わせることで、平均絶対誤差率(MAPE)が11.47%に達し、早期公開後の指標に依存するモデルと同等の性能を発揮する。
Predicting the popularity of online content has attracted much attention in the past few years. In news rooms, for instance, journalists and editors are keen to know, as soon as possible, the articles that will bring the most traffic into their website. The relevant literature includes a number of approaches and algorithms to perform this forecasting. Most of the proposed methods require monitoring the popularity of content during some time after it is posted, before making any longer-term prediction. In this paper, we propose a new approach for predicting the popularity of news articles before they go online. Our approach complements existing content-based methods, and is based on a number of observations regarding article similarity and topicality. First, the popularity of a new article is correlated with the popularity of similar articles of recent publication. Second, the popularity of the new article is related to the recent historical popularity of its main topic. Based on these observations, we use time series forecasting to predict the number of visits an article will receive. Our experiments, conducted on a real data collection of articles in an international news website, demonstrate the effectiveness and efficiency of the proposed method.
研究の動機と目的
- 出版前のニュース記事の人気を早期に予測可能とすることで、編集意思決定を支援すること。
- 早期公開後の人気データを必要とする従来のモデルの限界を克服すること。
- 話題の人気トレンドと記事の類似度を統合することで、予測精度を向上させること。
- コンテンツベースと時系列アプローチを組み合わせた予測モデルを構築し、より高い精度を達成すること。
- 早期指標に依存せずに、話題の人気予測が記事の人気予測を向上させられることを実証すること。
提案手法
- 本手法は、話題の歴史的アクセスパターンに基づき、その話題の人気度の将来予測に時系列予測を用いる。
- タイトルおよびコンテンツの埋め込み表現を用い、コサイン類似度の閾値(θ = 0.1)を満たす近い記事を、ターゲット記事と類似する記事として特定する。
- 類似記事のアクセス数をスライディングウインドウ(δ = 1, 2, 3, または 4日)で集計し、ターゲット記事の将来の人気度の予測子とする。
- 2つの予測子を組み合わせる:(1)類似記事のアクセス数、(2)話題の歴史的アクセス量。両者を線形回帰モデルに統合する。
- Section 4.4で最も性能の良かった予測手法を用いて、将来の話題の人気度を予測し、その値を統合することで、モデル性能をさらに向上させる。
- 最終的なアンサンブルモデルは、観測された類似トレンド、観測された話題の流入量、および予測された話題の流入量を、1つの回帰フレームワークに統合する。
実験結果
リサーチクエスチョン
- RQ1出版前における個々のニュース記事の人気を予測するために、話題の人気トレンドを活用できるか?
- RQ2最近公開された類似記事の人気度は、新規記事の将来の人気度とどの程度相関するか?
- RQ3記事の類似度と話題の人気予測を組み合わせることで、単独で用いる場合よりも予測精度が向上するか?
- RQ4出版前予測モデルの性能は、早期公開後の人気データを用いるモデルと比べてどうか?
- RQ5予測精度を最大化するために最適な時間窓(δ)は何か?
主な発見
- 提案手法は、記事の人気予測において平均絶対誤差率(MAPE)が11.47%に達し、早期人気データを用いるモデルと同等の性能を示す。
- 単一予測子アプローチに比べ、類似トレンドと話題の流入量の両方を用いることで、誤差が低減する。
- 予測された話題の流入量を組み込むことで、性能がわずかにでも向上し、特にδ = 3またはδ = 4日を用いる場合に顕著に効果を発揮する。
- 本手法は、早期人気測定データを一切必要とせず、MAPEが11.47%に留まるため、出版前における編集意思決定に適している。
- 5分、1時間、6時間の早期公開後データを用いるモデルは、それぞれMAPEが9.59%、6.83%、4.75%を達成するが、本手法の性能はそれらと同等である。
- 観測された類似トレンド、観測された話題の流入量、予測された話題の流入量を組み合わせた場合が最も優れた結果をもたらし、δ = 3またはδ = 4日が最も正確な予測をもたらす。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。