[論文レビュー] Cats and Captions vs. Creators and the Clock: Comparing Multimodal Content to Context in Predicting Relative Popularity
本稿では、ソーシャルメディアにおける相対的インプレッション数の予測において、マルチモーダルなコンテンツ(画像とキャプション)か、文脈的要因(作成者アイデンティティ、投稿時刻)のどちらがより優れた予測要因であるかを調査している。30秒以内に同じコミュニティに投稿されたReddit投稿のペアを比較することで、画像とキャプションの組み合わせ(「キャットとキャプション」)— つまり視覚的および文書的特徴の統合— が、社会的要因および時刻ベースのモデルを上回ることを明らかにした。マルチモーダルモデルは、6つのサブレdditのうち5つで、アップバッジ順位予測において最高の正確性を達成した。
The content of today's social media is becoming more and more rich, increasingly mixing text, images, videos, and audio. It is an intriguing research question to model the interplay between these different modes in attracting user attention and engagement. But in order to pursue this study of multimodal content, we must also account for context: timing effects, community preferences, and social factors (e.g., which authors are already popular) also affect the amount of feedback and reaction that social-media posts receive. In this work, we separate out the influence of these non-content factors in several ways. First, we focus on ranking pairs of submissions posted to the same community in quick succession, e.g., within 30 seconds, this framing encourages models to focus on time-agnostic and community-specific content features. Within that setting, we determine the relative performance of author vs. content features. We find that victory usually belongs to "cats and captions," as visual and textual features together tend to outperform identity-based features. Moreover, our experiments show that when considered in isolation, simple unigram text features and deep neural network visual features yield the highest accuracy individually, and that the combination of the two modalities generally leads to the best accuracies overall.
研究の動機と目的
- ソーシャルメディア投稿のインプレッション数を予測する際、投稿時刻やユーザーIDといった混同要因を除き、コンテンツの影響を分離すること。
- オンラインコミュニティにおける相対的インプレッション数の予測において、マルチモーダルなコンテンツ(画像とキャプション)か、社会的/文脈的特徴(投稿者ステータス、投稿時刻)のどちらがより予測的であるかを調査すること。
- 類似した投稿同士を公平に比較できるように、時間的制御とペアワイズ順位付けフレームワークを構築すること。
- 投稿時刻やユーザーIDといった社会的・時間的ベースラインと比較して、既存の視覚的および文書的特徴の相対的性能を評価すること。
- 今後のマルチモーダルコンテンツ好みに関する研究のための、公開可能なデータセットとベンチマークを提供すること。
提案手法
- 同じサブレdditに30秒以内に投稿されたマルチモーダルなReddit投稿(画像+キャプション)のペアを収集し、時間的およびコミュニティレベルの制御を確保する。
- ペアワイズ順位付けの設定を用い、類似した2つの投稿のうちどちらがより多くのアップバッジを受けるかを予測することで、投稿時刻やユーザーIDの影響を最小限に抑える。
- 既存の特徴を用いる:深層ニューラルネットワークによる視覚的埋め込み(例:ResNet)およびユニグラムテキスト特徴(TF-IDF や bag-of-words)をコンテンツモデリングに使用。
- 視覚的・文書的特徴(マルチモーダル含む)の予測性能を、社会的ベースライン(ユーザーのカマ)や時間的ベースラインと比較する。
- 2つの投稿のうちどちらがより多くのアップバッジを受けるかを予測するバイナリ分類器を訓練・評価し、正確性を主指標とする。
- 人間によるアノテーション研究を実施し、順位差の原因が隠れた順序付けやインターフェース効果ではなく、コンテンツの差であることを検証する。
実験結果
リサーチクエスチョン
- RQ1ソーシャルメディアにおいて、視覚的および文書的コンテンツ特徴が、社会的要因や時間的要因と比較して、相対的インプレッション数をどの程度うまく予測できるか。
- RQ2視覚的および文書的特徴を組み合わせることで、単体での使用に比べて予測正確性が向上するか。
- RQ3投稿時刻やユーザーIDを制御した状態で、さまざまな特徴タイプ(例:ユニグラムテキスト、深層視覚特徴)がアップバッジ順位予測においてどの程度の性能を示すか。
- RQ4どのコミュニティにおいて、コンテンツが投稿者のステータスや投稿時刻を上回って、投稿のインプレッション数を決定づけるか。
- RQ5リッチ・ゲット・リッチ効果が存在する現実のソーシャルメディア環境でも、コンテンツオンリーモデルが相対的インプレッション数を信頼性高く予測できるか。
主な発見
- 調査した6つのサブレdditのうち5つにおいて、視覚的および文書的特徴の組み合わせ(マルチモーダル)が、個々のモダリティおよび社会的/時刻ベースラインを上回り、相対的インプレッション数の予測において優れた性能を示した。
- 単体で評価した場合、深層ニューラルネットワークによる視覚的特徴が最も高い個別正確性を達成し、次にユニグラムテキスト特徴が続いた。
- 視覚的および文書的特徴の組み合わせが、最も高い全体的な予測正確性を達成し、両モダリティ間の相乗効果を示した。
- 本研究が採用した時間的制御付きペアリング手法により、投稿時刻やユーザーIDの影響が効果的に低減され、コンテンツの差がインプレッションの差を決定づけるという仮定が、大多数のケースで妥当であることが裏付けられた。
- 人間によるアノテーションにより、キャプションのユーモアや画像の品質といったコンテンツの差が、アップバッジの差の主な要因であることが確認された。隠れたインターフェース効果や順序付けバイアスは主な要因ではなかった。
- 1つのサブレddit(r/RedditLaqueristas)においては、社会的特徴(例:ユーザーのステータス)がコンテンツ特徴を上回る予測力を持ち、社会的要因の優位性が文脈依存的であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。