[논문 리뷰] To Post or Not to Post: Using Online Trends to Predict Popularity of Offline Content
이 논문은 뉴스 기사의 주제 인기도 시계열 예측과 최근에 발표된 유사 기사 간 유사도를 활용하여, 출판 이전에 뉴스 기사의 오프라인 인기도를 예측하는 새로운 방법을 제안한다. 유사 기사의 관측된 방문 패턴과 예측된 주제 볼륨을 결합함으로써, 평균 평균 백분율 오차(MAPE)가 11.47%에 도달하며, 출판 후 초기 데이터에 의존하는 모델과 견줄 만한 성능을 달성한다.
Predicting the popularity of online content has attracted much attention in the past few years. In news rooms, for instance, journalists and editors are keen to know, as soon as possible, the articles that will bring the most traffic into their website. The relevant literature includes a number of approaches and algorithms to perform this forecasting. Most of the proposed methods require monitoring the popularity of content during some time after it is posted, before making any longer-term prediction. In this paper, we propose a new approach for predicting the popularity of news articles before they go online. Our approach complements existing content-based methods, and is based on a number of observations regarding article similarity and topicality. First, the popularity of a new article is correlated with the popularity of similar articles of recent publication. Second, the popularity of the new article is related to the recent historical popularity of its main topic. Based on these observations, we use time series forecasting to predict the number of visits an article will receive. Our experiments, conducted on a real data collection of articles in an international news website, demonstrate the effectiveness and efficiency of the proposed method.
연구 동기 및 목표
- 출판 이전에 뉴스 기사의 인기를 조기에 예측함으로써 편집 결정 지원을 가능하게 하기 위해.
- 출판 후 초기 인기도 데이터가 필요로 하는 기존 모델의 한계를 해결하기 위해.
- 주제 인기도 추세와 기사 유사도를 통합함으로써 예측 정확도를 향상시키기 위해.
- 콘텐츠 기반 접근과 시계열 접근을 결합한 예측 모델을 개발하여 정확도를 높이기 위해.
- 주제 인기도 예측이 초기 측정 자료에 의존하지 않고도 기사 인기도 예측을 향상시킬 수 있음을 입증하기 위해.
제안 방법
- 이 방법은 해당 주제의 역사를 기반으로 한 방문 패턴을 바탕으로 기사 주제의 향후 인기도를 시계열 예측하는 방식을 사용한다.
- 타깃 기사와 유사한 최근 기사들을 제목 및 콘텐츠 임베딩의 코사인 유사도 임계값(θ = 0.1)을 사용해 식별한다.
- 이 모델은 슬라이딩 윈도우(δ = 1, 2, 3, 또는 4일)를 사용해 이러한 유사 기사들의 방문 수를 집계하여 타깃 기사의 향후 인기도 예측자로 사용한다.
- 두 예측자인 (1) 유사 기사의 방문 수와 (2) 기사 주제의 역사적 방문 볼륨을 선형 회귀 모델에 통합한다.
- Section 4.4에서 가장 성능이 뛰어난 예측 방법을 사용해 향후 주제 인기도를 예측한 값을 추가로 통합함으로써 성능을 향상시킨다.
- 최종 앙상블 모델은 관측된 유사도 추세, 관측된 주제 볼륨, 예측된 주제 볼륨을 하나의 회귀 프레임워크에 통합한다.
실험 결과
연구 질문
- RQ1출판 이전에 주제 인기도 추세를 활용해 개별 뉴스 기사의 향후 인기를 예측할 수 있는가?
- RQ2최근에 출판된 유사 기사의 인기도는 새로운 기사의 향후 인도와 어떻게 관련이 있는가?
- RQ3기사 유사도와 주제 인기도 예측을 결합하면 단독으로 사용할 경우보다 예측 정확도를 향상시킬 수 있는가?
- RQ4출판 전 예측 모델의 성능은 출판 후 초기 인기도 데이터를 사용하는 모델과 비교해 어떻게 되는가?
- RQ5예측 정확도를 극대화하기 위해 최근 방문 데이터를 집계할 최적의 시간 창(δ)은 얼마인가?
주요 결과
- 제안된 방법은 기사 인기도 예측에서 평균 평균 백분율 오차(MAPE)가 11.47%에 도달하며, 초기 인기도 데이터를 사용하는 모델과 유사한 성능을 보인다.
- 단일 예측자 접근 방식보다 성능이 뛰어나며, 유사도 추세와 주제 볼륨을 모두 사용할 경우 단독으로 사용할 경우보다 오차가 낮다.
- 예측된 주제 볼륨을 통합하면 성능이 약간이지만 일관되게 향상되며, 특히 δ = 3 또는 δ = 4일을 사용할 경우 두드러진다.
- 이 방법은 초기 인기도 측정 자료가 전혀 필요 없이 MAPE 11.47%를 달성하여 출판 전 편집 결정에 적합하다.
- 5분, 1시간, 6시간의 출판 후 초기 데이터를 사용하는 모델은 각각 MAPE 9.59%, 6.83%, 4.75%를 기록하며, 본 모델의 성능과 유사하다.
- 관측된 유사도 추세, 관측된 주제 볼륨, 예측된 주제 볼륨을 모두 통합할 경우 가장 우수한 성능을 달성하며, δ = 3 또는 δ = 4일이 가장 정확한 예측을 제공한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.