[论文解读] Cats and Captions vs. Creators and the Clock: Comparing Multimodal Content to Context in Predicting Relative Popularity
本文研究了多模态内容(图像与文字)或上下文因素(创作者身份、发布时间)哪一个更能预测社交媒体中的相对受欢迎程度。通过比较在30秒内发布到同一社区的Reddit帖子配对,发现‘猫图与文字’——即结合视觉与文本特征——优于社交与时间基线,在六个子版面中的五个中,多模态模型在预测点赞排名方面达到了最高准确率。
The content of today's social media is becoming more and more rich, increasingly mixing text, images, videos, and audio. It is an intriguing research question to model the interplay between these different modes in attracting user attention and engagement. But in order to pursue this study of multimodal content, we must also account for context: timing effects, community preferences, and social factors (e.g., which authors are already popular) also affect the amount of feedback and reaction that social-media posts receive. In this work, we separate out the influence of these non-content factors in several ways. First, we focus on ranking pairs of submissions posted to the same community in quick succession, e.g., within 30 seconds, this framing encourages models to focus on time-agnostic and community-specific content features. Within that setting, we determine the relative performance of author vs. content features. We find that victory usually belongs to "cats and captions," as visual and textual features together tend to outperform identity-based features. Moreover, our experiments show that when considered in isolation, simple unigram text features and deep neural network visual features yield the highest accuracy individually, and that the combination of the two modalities generally leads to the best accuracies overall.
研究动机与目标
- 为了在预测社交媒体帖子受欢迎程度时,将内容影响与时间与用户身份等混淆性上下文因素分离开来。
- 为了探究多模态内容(图像与文字)或社交/上下文特征(作者等级、发布时间)哪一个更能预测在线社区中的相对受欢迎程度。
- 为了开发一种时间受控的成对排名框架,实现在相似帖子之间对内容特征进行公平比较。
- 为了评估现成的视觉与文本特征相对于社交与时间基线在预测社区点赞行为方面的相对表现。
- 为未来关于社交媒体中多模态内容偏好的研究提供公开可获取的数据集与基准。
提出的方法
- 收集在30秒内发布到同一子版面的多模态Reddit帖子对(图像 + 文字),确保时间与社区层面的控制。
- 采用成对排名设置,预测两篇相似帖子中哪一篇获得更多点赞,以最小化时间与用户身份的影响。
- 使用现成特征:深度神经网络视觉嵌入(如ResNet)与一元语法文本特征(TF-IDF或词袋模型)进行内容建模。
- 将内容特征(视觉、文本、多模态)的预测性能与社交基线(用户积分、发布时间)和时间基线进行比较。
- 训练并评估二元分类器,以预测配对中哪一篇帖子获得更多点赞,以准确率为首要指标。
- 开展人工标注研究,以验证内容差异而非隐藏排序或界面效应,是导致受欢迎程度差异的主要原因。
实验结果
研究问题
- RQ1在社交媒体中,视觉与文本内容特征在预测相对受欢迎程度方面,与社交与时间因素相比,其预测效力如何?
- RQ2结合视觉与文本特征是否能提升预测准确率,使其超越单独使用任一模态的表现?
- RQ3在控制发布时间与用户身份的前提下,不同特征类型(如一元语法文本、深度视觉特征)在预测点赞排名方面的表现如何比较?
- RQ4在哪些社区中,内容特征主导了社会地位或发布时间对帖子受欢迎程度的影响?
- RQ5尽管存在‘富者愈富’效应,内容主导的模型是否能在现实社交媒体环境中可靠地预测相对受欢迎程度?
主要发现
- 在所考察的六个子版面中,五个子版面显示,多模态特征(视觉 + 文本)在预测相对受欢迎程度方面优于单一模态及社交/时间基线。
- 当单独考虑时,深度神经网络视觉特征实现了最高的个体准确率,其次为一元语法文本特征。
- 视觉与文本特征的结合产生了最高的整体预测准确率,表明两种模态之间存在协同效应。
- 本研究的时间受控配对方法有效降低了发布时间与用户身份的影响,验证了在大多数情况下,内容差异是驱动受欢迎程度的主要原因。
- 人工标注确认,内容差异(如文字幽默性、图像质量)是点赞差异的主要驱动因素,而非隐藏的界面或排序偏差。
- 在其中一个子版面(r/RedditLaqueristas)中,社交特征(如用户状态)比内容特征更具预测力,表明社交因素的主导作用具有情境依赖性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。