[论文解读] GOAT-Bench: Safety Insights to Large Multimodal Models through Meme-Based Social Abuse
本论文提出 GOAT-Bench,一个包含 6,626 个迷因的基准数据集,旨在针对多模态 AI 模型中的社会性虐待行为检测进行评估。该研究评估了大型多模态模型(LMMs)在仇恨言论、性别歧视、冒犯性、反讽及危害性方面的表现,揭示了尽管性能达到最先进水平,但在识别隐性虐待方面仍存在显著的安全漏洞,尤其在识别隐性性别歧视和反讽方面表现不足。
The exponential growth of social media has profoundly transformed how information is created, disseminated, and absorbed, exceeding any precedent in the digital age. Regrettably, this explosion has also spawned a significant increase in the online abuse of memes. Evaluating the negative impact of memes is notably challenging, owing to their often subtle and implicit meanings, which are not directly conveyed through the overt text and image. In light of this, large multimodal models (LMMs) have emerged as a focal point of interest due to their remarkable capabilities in handling diverse multimodal tasks. In response to this development, our paper aims to thoroughly examine the capacity of various LMMs (e.g., GPT-4o) to discern and respond to the nuanced aspects of social abuse manifested in memes. We introduce the comprehensive meme benchmark, GOAT-Bench, comprising over 6K varied memes encapsulating themes such as implicit hate speech, sexism, and cyberbullying, etc. Utilizing GOAT-Bench, we delve into the ability of LMMs to accurately assess hatefulness, misogyny, offensiveness, sarcasm, and harmful content. Our extensive experiments across a range of LMMs reveal that current models still exhibit a deficiency in safety awareness, showing insensitivity to various forms of implicit abuse. We posit that this shortfall represents a critical impediment to the realization of safe artificial intelligence. The GOAT-Bench and accompanying resources are publicly accessible at https://goatlmm.github.io/, contributing to ongoing research in this vital field.
研究动机与目标
- 为应对迷因中微妙且隐性的社会性虐待行为检测挑战,特别是涉及仇恨言论、性别歧视与网络欺凌的多模态、依赖上下文的特性。
- 系统性评估大型多模态模型(LMMs)在识别嵌入迷因中的细微形式在线虐待行为方面的安全意识水平。
- 开发一个全面且公开可用的基准(GOAT-Bench),涵盖多种伤害维度的真实世界迷因虐待行为。
- 探究思维链(CoT)提示在提升 LMMs 对迷因中复杂隐性虐待行为推理与检测准确率方面的作用。
- 通过揭示当前 LMMs 在社会与伦理推理方面的局限性,尤其在高风险的真实社交媒体场景中,推动更安全的 AI 发展。
提出的方法
- 构建了 GOAT-Bench,一个从公开来源收集的 6,626 个迷因的精选数据集,包括 Facebook Hateful Meme 数据集,对五类虐待行为(仇恨性、性别歧视、冒犯性、反讽与危害性)进行了明确标注。
- 采用多阶段标注流程,由接受过训练的人类评估员识别细微的隐性虐待形式,通过知情同意、工作量限制与心理福祉检查,确保高一致性与心理安全。
- 使用零样本与思维链(CoT)提示策略,对一系列最先进 LMMs(包括 GPT-4V、LLaVA-1.5、InstructBLIP、CogVLM、Qwen-VL 与 MiniGPT-4)在该基准上进行评估。
- 设计了特定任务的评估协议,以评估模型在五个不同虐待检测任务中的表现,实现对模型优势与缺陷的细致分析。
- 实施严格的数据治理:仅将来自 Facebook 迷因的文本标注纳入 GOAT-Bench,原始图像需单独从 Facebook Hateful Meme 挑战中下载,以符合许可要求。
- 使用标准化指标比较模型在各项任务中的表现,包括准确率、F1 分数与 AUC,其中 GPT-4V 在整体表现上最高。
实验结果
研究问题
- RQ1当前大型多模态模型(LMMs)在多大程度上能准确检测依赖视觉与文本线索结合的隐性仇恨言论与社会性虐待?
- RQ2思维链(CoT)提示在多大程度上提升了 LMMs 对复杂多模态虐待形式(如反讽与细微性别歧视)的推理与分类能力?
- RQ3当迷因通过文化、政治或讽刺性引用隐含表达有害内容而非使用明确语言时,LMMs 的关键失败模式是什么?
- RQ4不同 LMM 架构与训练数据分布如何影响其在检测迷因中细微且依赖上下文的在线虐待行为方面的表现?
- RQ5像 GOAT-Bench 这样标准化且全面的基准能否有效揭示传统多模态基准未能捕捉到的 LMMs 安全缺陷?
主要发现
- GPT-4V 在 GOAT-Bench 上所有五个虐待检测任务中均取得最高整体表现,优于其他领先 LMMs(如 LLaVA-1.5、InstructBLIP 与 Qwen-VL)。
- 尽管表现优异,GPT-4V 在识别隐性虐待方面仍存在显著局限,尤其在反讽与细微性别歧视内容上,表明其在安全推理方面存在根本性缺陷。
- 思维链(CoT)提示提升了多个 LMMs 的检测准确率,尤其在识别反讽与间接仇恨言论等复杂推理任务中,但不同模型间的提升效果不一致。
- 许多 LMMs 未能识别依赖文化或政治引用的有害迷因,表明其在表面文本或图像特征之外的语境嵌入式虐待行为上泛化能力差。
- 研究发现,当前 LMMs 常将具有隐性或讽刺性虐待的迷因误判为非冒犯性内容,揭示了在真实部署场景中存在关键安全漏洞。
- 该基准暴露出现有模型在检测细微在线虐待行为时,与人类社会价值观的对齐性不足,尤其在视觉与文本线索矛盾或模糊意图时表现更差。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。