[論文レビュー] SMP Challenge: An Overview of Social Media Prediction Challenge 2019
本論文は、公開前に今後の投稿の人気度(いいね数、再生回数など)を予測する、時間的ポピュラリティ予測(TPP)に焦点を当てた大規模なソーシャルマルチメディア予測チャレンジ「SMP Challenge 2019」を紹介する。486,000件の投稿と80,000人のユーザーを含む、視覚的・文章的・時間的メタデータが豊富な新規リリースのSMPDデータセットを用い、スピアマン順位相関と平均絶対誤差を用いてモデルを評価することで、ソーシャルメディア分析における予測学習の発展を図る。
"SMP Challenge" aims to discover novel prediction tasks for numerous data on social multimedia and seek excellent research teams. Making predictions via social multimedia data (e.g. photos, videos or news) is not only helps us to make better strategic decisions for the future, but also explores advanced predictive learning and analytic methods on various problems and scenarios, such as multimedia recommendation, advertising system, fashion analysis etc. In the SMP Challenge at ACM Multimedia 2019, we introduce a novel prediction task Temporal Popularity Prediction, which focuses on predicting future interaction or attractiveness (in terms of clicks, views or likes etc.) of new online posts in social media feeds before uploading. We also collected and released a large-scale SMPD benchmark with over 480K posts from 69K users. In this paper, we define the challenge problem, give an overview of the dataset, present statistics of rich information for data and annotation and design the accuracy and correlation evaluation metrics for temporal popularity prediction to the challenge.
研究の動機と目的
- 時間的ポピュラリティ予測タスクを導入することで、ソーシャルマルチメディア予測のための新規で大規模なベンチマークを確立すること。
- 実世界の予測研究を支援するため、80,000人のユーザーと486,000件以上の投稿を含む多様でマルチモーダルなデータセット(SMPD)を収集・リリースすること。
- 時間的ポピュラリティ予測のパフォーマンスを評価するための標準化された評価指標(スピアマン順位相関と平均絶対誤差)を定義すること。
- マルチモーダルなコンテンツと時間的ダイナミクスを用いて、投稿が公開される前に対応する人気度を予測するチャレンジを通じて、予測学習分野におけるイノベーションを促進すること。
- ユーザー、地理的地域、コンテンツモダリティの多様性を確保することで、異なるソーシャルメディア文脈におけるモデルの汎化性能を高めること。
提案手法
- SMPDデータセットは、ソーシャルメディア投稿の時系列的連続性を保つために時系列順に構築されている。
- 各投稿には視覚的コンテンツ(意味的カテゴリを有する画像)、文章的コンテンツ(タイトルとユーザー生成タグ)、メタデータ(場所、時刻、ユーザープロフィール)が含まれる。
- 地理的地域間の分布をバランスさせるために、ログ正規化戦略が適用され、グローバルな代表性が確保されている。
- 評価には時系列分割戦略が用いられ、10個の時系列ウィンドウに分割され、2:1の割合で訓練用とテスト用に分離され、ユーザー・投稿の時系列順序が保持されている。
- パフォーマンスは2つの指標で評価される:順位付けの正確性を測るスピアマン順位相関(SRC)と、予測誤差を定量化する平均絶対誤差(MAE)。
- 最終的なチーム順位は、両方の指標におけるパフォーマンスを統合することで算出され、バランスの取れた評価が保証されている。
実験結果
リサーチクエスチョン
- RQ1投稿の内容と文脈に基づいて、公開前にソーシャルメディア投稿の人気度を予測する最も効果的な方法は何か?
- RQ2視覚的・文章的・時間的特徴が、ソーシャルメディアにおける投稿の人気度予測可能性にどのように寄与するか?
- RQ3画像・文章・時刻といったマルチモーダル特徴は、単一モーダルなアプローチと比較して、時間的ポピュラリティ予測をどの程度向上できるか?
- RQ4データセットにおける地理的およびユーザーの多様性は、異なるソーシャルメディア文脈におけるモデルの汎化性能とパフォーマンスにどのように影響するか?
- RQ5実世界のソーシャルメディアシステムにおいて、時間的ポピュラリティ予測の質を最も適切に反映する評価指標は何か?
主な発見
- SMPDデータセットには、80,000人のユーザーからなる486,000件の投稿が含まれており、視覚的コンテンツ、タイトル、タグ、時間的メタデータを含む多様なマルチモーダル情報が豊富に含まれる。
- データセットは多様な地理的地域をカバーしており、地域バイアスを低減するためにログ正規化が適用され、分布が調整されている。
- 人気スコアの分布は顕著に歪んでおり、大多数の投稿は低エンゲージメントを示し、少数の投稿が高バイラル性を達成している。
- 評価プロトコルでは、ユーザー・投稿の時系列順序の整合性を保つための時系列分割戦略が用いられ、現実的な時間的評価が可能になっている。
- 主な評価指標としてスピアマン順位相関と平均絶対誤差(MAE)が使用され、最終順位は両方の指標における統合パフォーマンスに基づいて算出されている。
- 本チャレンジは、多様なソーシャルメディアシナリオにおける予測モデルのベンチマーク化に成功し、マルチメディア予測と分析分野の研究を前進させた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。