Skip to main content
QUICK REVIEW

[논문 리뷰] SMP Challenge: An Overview of Social Media Prediction Challenge 2019

Bo Wu, Wen-Huang Cheng|arXiv (Cornell University)|2019. 10. 04.
Sentiment Analysis and Opinion Mining참고 문헌 25인용 수 4
한 줄 요약

이 논문은 시계열 인기 예측(Temporal Popularity Prediction, TPP)에 중점을 두고, 발표 이전에 미래의 게시물 인기도(예: 좋아요, 조회수)를 예측하는 대규모 사회미디어 예측 챌린지인 SMP 챌린지 2019을 소개한다. 80,000명의 사용자로부터 수집된 486,000개의 게시물과 시각적, 텍스처적, 시계열 메타데이터를 포함한 새로운 SMPD 데이터셋을 활용하여, 모델은 스피어만 상관계수와 평균 절대 오차를 사용해 평가되며, 이는 사회미디어 분석 분야의 예측 학습을 촉진한다.

ABSTRACT

"SMP Challenge" aims to discover novel prediction tasks for numerous data on social multimedia and seek excellent research teams. Making predictions via social multimedia data (e.g. photos, videos or news) is not only helps us to make better strategic decisions for the future, but also explores advanced predictive learning and analytic methods on various problems and scenarios, such as multimedia recommendation, advertising system, fashion analysis etc. In the SMP Challenge at ACM Multimedia 2019, we introduce a novel prediction task Temporal Popularity Prediction, which focuses on predicting future interaction or attractiveness (in terms of clicks, views or likes etc.) of new online posts in social media feeds before uploading. We also collected and released a large-scale SMPD benchmark with over 480K posts from 69K users. In this paper, we define the challenge problem, give an overview of the dataset, present statistics of rich information for data and annotation and design the accuracy and correlation evaluation metrics for temporal popularity prediction to the challenge.

연구 동기 및 목표

  • 시계열 인기 예측 작업을 도입함으로써 사회미디어 예측을 위한 새로운 대규모 벤치마크를 구축하기 위해.
  • 실제 연구에 활용 가능한 다양한 다중모odal 데이터셋(SMPD)을 수집하고 공개하여 486,000개 이상의 게시물과 80,000명의 사용자를 포함하기 위해.
  • 시계열 인기 예측 성능 평가를 위한 표준화된 평가 지표인 스피어만 상관계수와 평균 절대 오차를 정의하기 위해.
  • 다중모달 콘텐츠와 시계열 동적 특성을 활용하여 게시물의 인기도를 발표 이전에 예측하는 도전을 통해 예측 학습 분야의 혁신을 촉진하기 위해.
  • 사용자, 지리적 지역, 콘텐츠 모odal리티 간의 데이터 다양성을 확보하여 다양한 작업 간 일반화 능력을 향상시키기 위해.

제안 방법

  • SMPD 데이터셋은 사회미디어 게시물의 시계열 순서를 유지하기 위해 시간 순서에 따라 구성된다.
  • 각 게시물은 시각적 콘텐츠(세분화된 의미 카테고리가 부여된 이미지), 텍스트 콘텐츠(제목 및 사용자 생성 태그), 메타데이터(위치, 시간, 사용자 프로필)를 포함한다.
  • 지역 간 불균형을 줄이기 위해 지리적 영역별 게시물 분포를 균형 잡기 위해 로그 정규화 전략을 적용한다.
  • 평가에는 시계열 분할 전략을 사용한다: 10개의 시간 창으로 구성된 시퀀스는 훈련과 테스트로 2:1 비율로 분할되며, 사용자-게시물 순서를 유지한다.
  • 성능 평가는 두 가지 지표를 사용한다: 순서형 랭킹 정확도를 측정하기 위한 스피어만 순위 상관계수(SRC)와 예측 오차를 정량화하기 위한 평균 절대 오차(MAE)이다.
  • 최종 팀 순위는 두 지표의 성능을 통합하여 계산하여 평가의 균형을 확보한다.

실험 결과

연구 질문

  • RQ1게시물의 콘텐츠와 맥락을 바탕으로 발표 이전에 향후 인기도를 예측하는 데 가장 효과적인 방법은 무엇인가?
  • RQ2시각적, 텍스처적, 시계열 특성이 사회미디어에서 게시물 인기도의 예측 가능성에 어떻게 상호작용하는가?
  • RQ3이중모달 특성(이미지, 텍스트, 시간)이 단일모달 접근 방식에 비해 시계열 인기 예측 성능을 얼마나 향상시킬 수 있는가?
  • RQ4데이터셋 내 지리적 및 사용자 다양성이 다양한 사회미디어 맥락에서 모델의 일반화 능력과 성능에 어떤 영향을 미치는가?
  • RQ5실제 사회미디어 시스템에서 시계열 인기 예측의 품질을 가장 잘 반영하는 평가 지표는 무엇인가?

주요 결과

  • SMPD 데이터셋은 80,000명의 사용자로부터 수집된 486,000개의 게시물로 구성되어 있으며, 시각적 콘텐츠, 제목, 태그, 시계열 메타데이터를 포함한 풍부한 다중모달 정보를 제공한다.
  • 데이터셋은 다양한 지리적 지역을 포함하며, 지역 간 편향을 줄이기 위해 로그 정규화를 통해 게시물 분포가 균형 잡혀 있다.
  • 인기 점수 분포는 매우 비대칭적이며, 대부분의 게시물은 낮은 참여도를 보이고, 소수의 게시물만 높은 확산성을 달성한다.
  • 평가 프로토콜은 사용자-게시물 순서의 무결성을 유지하는 시계열 분할 전략을 사용하여 현실적인 시계열 평가를 보장한다.
  • 주요 평가 지표로 스피어만 상관계수와 평균 절대 오차(MAE)를 사용하며, 최종 순위는 두 지표의 통합 성능에 기반한다.
  • 이 챌린지는 다양한 사회미디어 시나리오에서 예측 모델의 벤치마크를 성공적으로 제공하여, 멀티미디어 예측 및 분석 분야의 연구를 진전시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.