Skip to main content
QUICK REVIEW

[論文レビュー] GOAT-Bench: Safety Insights to Large Multimodal Models through Meme-Based Social Abuse

Hongzhan Lin, Ziyang Luo|arXiv (Cornell University)|Jan 3, 2024
Hate Speech and Cyberbullying Detection被引用数 4
ひとこと要約

本論文は、マルチモodal AIモデルにおける社会的いじめの検出を対象とした6,626枚のミームを含むベンチマーク、GOAT-Benchを紹介する。この研究では、嫌悪、ミソジニー、攻撃的発言、皮肉、有害性の5つの分野について大規模マルチモーダルモデル(LMMs)を評価し、特に内面的ないじめの検出において、最先端の性能を示してもなお顕著なセーフティのギャップが存在することが明らかになった。

ABSTRACT

The exponential growth of social media has profoundly transformed how information is created, disseminated, and absorbed, exceeding any precedent in the digital age. Regrettably, this explosion has also spawned a significant increase in the online abuse of memes. Evaluating the negative impact of memes is notably challenging, owing to their often subtle and implicit meanings, which are not directly conveyed through the overt text and image. In light of this, large multimodal models (LMMs) have emerged as a focal point of interest due to their remarkable capabilities in handling diverse multimodal tasks. In response to this development, our paper aims to thoroughly examine the capacity of various LMMs (e.g., GPT-4o) to discern and respond to the nuanced aspects of social abuse manifested in memes. We introduce the comprehensive meme benchmark, GOAT-Bench, comprising over 6K varied memes encapsulating themes such as implicit hate speech, sexism, and cyberbullying, etc. Utilizing GOAT-Bench, we delve into the ability of LMMs to accurately assess hatefulness, misogyny, offensiveness, sarcasm, and harmful content. Our extensive experiments across a range of LMMs reveal that current models still exhibit a deficiency in safety awareness, showing insensitivity to various forms of implicit abuse. We posit that this shortfall represents a critical impediment to the realization of safe artificial intelligence. The GOAT-Bench and accompanying resources are publicly accessible at https://goatlmm.github.io/, contributing to ongoing research in this vital field.

研究の動機と目的

  • ミームにおける嫌悪、性差別、ネットいじめといった、マルチモーダルで文脈依存的な性質を持つ、微細で内面的な社会的いじめの検出という、増加する挑戦に応えること。
  • 大規模マルチモーダルモデル(LMMs)の社会的・倫理的認識の意識について、ミームに埋め込まれた洗練された形でのオンラインいじめを識別する能力を体系的に評価すること。
  • 多様で現実世界のミームベースのいじめを、有害性の複数の次元にわたって捉える、包括的で公開可能なベンチマーク(GOAT-Bench)を構築すること。
  • チェーン・オブ・トゥーク(CoT)プロンプティングの有効性を検証し、複雑で内面的ないじめの検出におけるLMMの推論力と正確性を向上させるかを調査すること。
  • 現在のLMMが社会的・倫理的推論において抱える限界を露呈させ、とりわけ高リスクの現実世界のソーシャルメディア環境において、より安全なAI開発に貢献すること。

提案手法

  • Facebook Hateful Memeデータセットなど、公開ソースから収集した6,626枚のミームを含む、キュレートされたデータセットであるGOAT-Benchを構築。嫌悪、ミソジニー、攻撃的発言、皮肉、有害性の5つのいじめカテゴリーについて明示的なアノテーションを付与した。
  • 微細で内面的ないじめの形態を特定できるように訓練された人間の評価者を用いたマルチステージのアノテーションプロセスを採用。相互評価者間の一貫性を高めるため、同意、作業量の上限、およびウェルネスチェックを通じて心理的安心を確保した。
  • GPT-4V、LLaVA-1.5、InstructBLIP、CogVLM、Qwen-VL、MiniGPT-4など、最先端のLMMを、ゼロショットおよびチェーン・オブ・トゥーク(CoT)プロンプティング戦略を用いてベンチマークで評価した。
  • モデルの性能を5つの異なるいじめ検出タスクにわたり分析可能なように、タスク固有の評価プロトコルを設計し、モデルの強みと弱みを詳細に分析可能にした。
  • 厳密なデータガバナンスを実施:GOAT-BenchにはFacebookのミームからのみテキストアノテーションを含め、元の画像はFacebook Hateful Memeチャレンジから別途ダウンロードするようにし、ライセンス要件を遵守した。
  • 標準化された指標を用いて、各タスクにおけるモデルのパフォーマンスを比較。正確性、F1スコア、AUCを用い、GPT-4Vが最も高い全体的なパフォーマンスを示した。

実験結果

リサーチクエスチョン

  • RQ1現在の大規模マルチモーダルモデル(LMMs)は、視覚的および言語的側面が組み合わさった場合に意味を成すミームにおける、内面的な嫌悪発言や社会的いじめをどの程度正確に検出できるか?
  • RQ2チェーン・オブ・トゥーク(CoT)プロンプティングは、皮肉や微細なミソジニーといった洗練されたマルチモーダルないじめ形態を推論し、正しく分類するLMMの能力にどのように影響するか?
  • RQ3明示的な言語ではなく、文化的・政治的・皮肉的な参照によって有害な内容を埋め込んでいるミームに対して、LMMが示す主な失敗モードは何か?
  • RQ4異なるLMMアーキテクチャーやトレーニングデータの分布は、ミームにおける微細で文脈依存的なオンラインいじめの検出性能にどのように影響するか?
  • RQ5GOAT-Benchのような標準的で包括的なベンチマークは、従来のマルチモーダルベンチマークでは捉えきれないLMMのセーフティ上の欠陥を効果的に明らかにできるか?

主な発見

  • GPT-4Vは、GOAT-Benchの全5つのいじめ検出タスクにおいて、LLaVA-1.5、InstructBLIP、Qwen-VLなどの他の先端的LMMを上回る最高の全体的パフォーマンスを示した。
  • 強力なパフォーマンスを示しても、GPT-4Vですら皮肉や微細なミソジニーやいじめの検出において顕著な限界を示しており、セーフティ推論における根本的なギャップが存在することが示された。
  • チェーン・オブ・トゥーク(CoT)プロンプティングは、皮肉や間接的な嫌悪発言といった複雑な推論タスクにおいて、複数のLMMの検出正確性を向上させたが、モデルごとの向上幅は一貫していなかった。
  • 多くのLMMは、文化的または政治的な参照に依存する有害なミームを認識できず、表面的なテキストや画像特徴を超えた文脈に埋め込まれたいじめに対する一般化能力が著しく低いことが明らかになった。
  • 本研究では、内面的または皮肉的ないじめを含むミームを、モデルが非攻撃的と誤分類する傾向があることが判明し、現実世界の展開において深刻なセーフティの脆弱性が浮き彫りになった。
  • ベンチマークは、視覚的および言語的側面が矛盾したり、意図されたメッセージをぼかしたりする状況において、現在のLMMが人間の社会的価値観との整合性を十分に持っていないことが明らかになった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。