[论文解读] A Multimodal Analysis of Influencer Content on Twitter
本文引入了一个新的、由专家标注的 Twitter 数据集,包含 15,998 条影响力者发布的内容,按商业或非商业类别进行标注,并提出一种交叉注意力多模态模型(ViT-BERTweet-Att),通过结合文本与图像特征,在检测隐藏商业内容方面优于最先进模型,显著降低误报率,并提高对未披露赞助内容的检测能力。
Influencer marketing involves a wide range of strategies in which brands collaborate with popular content creators (i.e., influencers) to leverage their reach, trust, and impact on their audience to promote and endorse products or services. Because followers of influencers are more likely to buy a product after receiving an authentic product endorsement rather than an explicit direct product promotion, the line between personal opinions and commercial content promotion is frequently blurred. This makes automatic detection of regulatory compliance breaches related to influencer advertising (e.g., misleading advertising or hidden sponsorships) particularly difficult. In this work, we (1) introduce a new Twitter (now X) dataset consisting of 15,998 influencer posts mapped into commercial and non-commercial categories for assisting in the automatic detection of commercial influencer content; (2) experiment with an extensive set of predictive models that combine text and visual information showing that our proposed cross-attention approach outperforms state-of-the-art multimodal models; and (3) conduct a thorough analysis of strengths and limitations of our models. We show that multimodal modeling is useful for identifying commercial posts, reducing the amount of false positives, and capturing relevant context that aids in the discovery of undisclosed commercial posts.
研究动机与目标
- 为解决在影响力者内容中检测未披露商业内容的挑战,其中推广信息常被伪装成个人观点。
- 创建一个大规模、由专家标注的 Twitter 内容数据集,按商业意图与非商业意图分类,以支持自动检测研究。
- 评估多模态方法(结合文本与视觉特征)在区分真实个人内容与隐藏产品推广方面的有效性。
- 探究现有模型的局限性,并识别在何种情况下文本、视觉或多模态融合方法在商业内容检测中最为有效。
- 为未来在多语言与跨文化影响力者广告合规性分析方面的研究提供基础。
提出的方法
- 从 Twitter(现为 X)精选了 15,998 条影响力者推文,包括 14,384 个图文对与 1,614 条纯文本帖子,由专家标注为商业或非商业类别。
- 采用交叉注意力机制融合视觉变换器(ViT)与微调后的 BERTweet 模型的表征,实现模态间的动态交互。
- 将所提模型与最先进视觉、语言及多模态模型进行基准对比,包括使用零样本与 few-shot 提示策略的大型语言模型(LLM)提示。
- 以关键词匹配与领域特定术语列表(如 #ad、#sponsored)作为基线,但重点在于学习超越显式披露术语的上下文与风格线索。
- 对误分类样本进行定性分析,以识别重复出现的错误模式与模型局限性。
- 在时间扩展的数据集上验证结果,覆盖 2015 年 1 月至 2021 年 8 月期间,涵盖美容、旅游、食品、健身、科技与生活方式等类别。

实验结果
研究问题
- RQ1与单模态或基于关键词的方法相比,多模态建模在区分商业与非商业影响力者内容方面的有效性如何?
- RQ2当前模型在检测隐藏商业帖子时的主要失败模式是什么,特别是在披露信息缺失或模糊的情况下?
- RQ3在哪些情境下视觉特征比文本线索更具贡献,反之亦然,用于商业内容检测?
- RQ4交叉注意力机制是否能优于标准的晚期或早期融合策略,在多模态影响力者内容分类中提升性能?
- RQ5文本与图像组合中的风格与上下文线索如何帮助检测超越关键词匹配的未披露赞助内容?
主要发现
- 所提出的交叉注意力多模态模型 ViT-BERTweet-Att 在检测影响力者商业内容方面优于所有基线模型,包括最先进的多模态架构。
- 与基于关键词的基线相比,多模态建模将误报率降低了 85%,后者常将包含推广关键词的非商业内容误判为商业内容。
- 在文本模型失败的 15% 案例中,该模型成功识别出未披露的商业内容,尤其在无品牌提及但视觉线索暗示产品推广时表现突出。
- 最常见的错误类型(占 20%)涉及描述个人经历的内容,尤其是旅游类内容,缺乏品牌名称或显式披露,对文本与多模态模型均构成挑战。
- 文本模型常因在非推广语境中使用推广关键词,而将非商业内容误判为商业内容,凸显了对上下文理解的需求。
- 该模型表明,视觉特征与文本中的风格线索(如产品摆放、美学构图)在检测伪装成个人内容的原生广告中至关重要。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。