Skip to main content
QUICK REVIEW

[논문 리뷰] GOAT-Bench: Safety Insights to Large Multimodal Models through Meme-Based Social Abuse

Hongzhan Lin, Ziyang Luo|arXiv (Cornell University)|2024. 01. 03.
Hate Speech and Cyberbullying Detection인용 수 4
한 줄 요약

이 논문은 6,626개의 멤에를 포함하는 GOAT-Bench를 소개하며, 이는 다중모odal AI 모델에서의 사회적 폭력 행위 탐지에 초점을 맞춘 벤치마크이다. 이는 대규모 다중모달 모델(LMMs)이 증오심, 여성 혐오, 모욕성, 비꼬임, 유해성 등에 대해 평가되며, 최첨단 성능에도 불구하고 암시적 폭력 행위 탐지에서 뚜렷한 안전성 격차를 드러내고 있다.

ABSTRACT

The exponential growth of social media has profoundly transformed how information is created, disseminated, and absorbed, exceeding any precedent in the digital age. Regrettably, this explosion has also spawned a significant increase in the online abuse of memes. Evaluating the negative impact of memes is notably challenging, owing to their often subtle and implicit meanings, which are not directly conveyed through the overt text and image. In light of this, large multimodal models (LMMs) have emerged as a focal point of interest due to their remarkable capabilities in handling diverse multimodal tasks. In response to this development, our paper aims to thoroughly examine the capacity of various LMMs (e.g., GPT-4o) to discern and respond to the nuanced aspects of social abuse manifested in memes. We introduce the comprehensive meme benchmark, GOAT-Bench, comprising over 6K varied memes encapsulating themes such as implicit hate speech, sexism, and cyberbullying, etc. Utilizing GOAT-Bench, we delve into the ability of LMMs to accurately assess hatefulness, misogyny, offensiveness, sarcasm, and harmful content. Our extensive experiments across a range of LMMs reveal that current models still exhibit a deficiency in safety awareness, showing insensitivity to various forms of implicit abuse. We posit that this shortfall represents a critical impediment to the realization of safe artificial intelligence. The GOAT-Bench and accompanying resources are publicly accessible at https://goatlmm.github.io/, contributing to ongoing research in this vital field.

연구 동기 및 목표

  • 멀티모달적이고 맥락에 의존적인 특성으로 인해 증오 발언, 성차별, 사이버불링 등에 관여하는 암시적이고 미묘한 사회적 폭력 행위를 탐지하는 데 증가하는 도전 과제를 해결하기 위해.
  • 멤을 통해 잠재된 복잡한 형태의 온라인 폭력 행위를 식별하는 데 있어 대규모 다중모달 모델(LMMs)의 안전 인식 능력을 체계적으로 평가하기 위해.
  • 다양하고 실제 세계적인 멤 기반의 폭력 행위를 여러 해로 나누어 포괄적으로 캡처하는 공개 가능한 벤치마크(GOAT-Bench)를 개발하기 위해.
  • 체인 오브 톰(Chain-of-Thought, CoT) 프롬프팅이 멤에서 복잡하고 암시적인 폭력 행위 탐지에 있어 LMMs의 추론 능력과 정확도 향상에 얼마나 효과적인지 조사하기 위해.
  • 현재 LMMs의 사회적 및 윤리적 추론 능력의 한계를 드러내어, 특히 고위험의 실제 소셜 미디어 환경에서의 안전한 AI 개발에 기여하기 위해.

제안 방법

  • 공개 자료에서 수집한 6,626개의 멤을 포함하는 정제된 데이터셋인 GOAT-Bench를 구축하였으며, 이는 페이스북의 Hateful Meme 데이터셋을 포함하고 있으며, 증오심, 여성 혐오, 모욕성, 비꼬임, 유해성 등 다섯 가지 폭력 유형에 대해 명시적인 애너테이션을 제공하였다.
  • 암시적 폭력 행위를 식별할 수 있도록 훈련된 인간 평가자들을 활용한 다단계 애너테이션 프로세스를 시행하였으며, 상호 평가자 간 일致도를 높이고 심리적 안전을 확보하기 위해 동의, 작업량 제한 및 복지 점검을 실시하였다.
  • GPT-4V, LLaVA-1.5, InstructBLIP, CogVLM, Qwen-VL, MiniGPT-4 등의 최첨단 LMMs를 사용하여, 제로샷 및 체인 오브 톰(Chain-of-Thought, CoT) 프롬프팅 전략을 적용해 벤치마크에서 평가하였다.
  • 모델 성능을 다섯 가지 별도의 폭력 행위 탐지 작업에 대해 분석할 수 있도록 전용 평가 프로토콜을 설계하여, 모델의 강점과 약점을 세밀하게 분석할 수 있도록 하였다.
  • 엄격한 데이터 거버넌스를 구현하였으며, 라 ли선스에 따라 Facebook Hateful Meme 챌린지에서 별도로 이미지를 다운로드할 수 있도록 하였고, GOAT-Bench에는 텍스트 애너테이션만 포함되었다.
  • 정규화된 메트릭을 사용하여 다양한 작업 간 모델 성능을 비교하였으며, 정확도, F1 점수, AUC 등을 포함하여 GPT-4V가 가장 높은 종합 성능을 기록하였다.

실험 결과

연구 질문

  • RQ1현재의 대규모 다중모달 모델(LMMs)은 시각적 및 텍스트적 신호가 결합된 경우에 암시적 증오 발언과 사회적 폭력 행위를 멤에서 얼마나 정확하게 탐지할 수 있는가?
  • RQ2체인 오브 톰(CoT) 프롬프팅은 비꼬임이나 암시적 여성 혐오와 같은 복잡한 다중모달 폭력 행위를 추론하고 정확하게 분류하는 데 있어 LMMs의 능력에 어떤 영향을 미치는가?
  • RQ3암시적 언어나 명시적 언어가 아닌 문화적, 정치적 또는 비꼬임의 참조를 통해 해로운 내용을 내포한 멤을 만났을 때 LMMs의 주요 실패 원인은 무엇인가?
  • RQ4다른 LMM 아키텍처와 학습 데이터 분포는 멤에서 암시적이고 맥락에 의존적인 형태의 온라인 폭력 행위 탐지 성능에 어떤 영향을 미치는가?
  • RQ5표준화되고 종합적인 벤치마크인 GOAT-Bench는 전통적인 다중모달 벤치마크가 포착하지 못하는 LMMs의 안전성 결함을 효과적으로 드러낼 수 있는가?

주요 결과

  • GPT-4V는 GOAT-Bench에서 다섯 가지 폭력 행위 탐지 작업 전반에서 가장 높은 종합 성능을 기록하였으며, LLaVA-1.5, InstructBLIP, Qwen-VL 등의 다른 주요 LMMs를 앞섰다.
  • 강력한 성능에도 불구하고, GPT-4V 역시 비꼬임과 암시적 여성 혐오 콘텐츠 탐지에서 뚜렷한 한계를 보이며, 안전 추론 측면에서 근본적인 격차가 있음을 시사한다.
  • 체인 오브 톰(CoT) 프롬프팅은 비꼬임과 간접적 증오 발언과 같은 복잡한 추론 작업에서 몇몇 LMMs의 탐지 정확도를 향상시켰지만, 다양한 모델 간 성과 향상은 일관되지 않았다.
  • 많은 LMMs는 문화적 또는 정치적 참조에 의존하는 해로운 멤을 인식하지 못했으며, 표면적 텍스트나 이미지 특징을 초월해 맥락에 묻힌 폭력 행위에 대한 일반화 능력이 떨어지는 것으로 나타났다.
  • 연구에서 현재 LMMs가 암시적 또는 비꼬임 폭력 행위를 가진 멤을 비폭력으로 잘못 분류하는 경우가 많다는 점이 드러났으며, 실제 배포 환경에서의 치명적인 안전성 취약점을 드러냈다.
  • 벤치마크를 통해 기존 모델들이 비록 시각적 및 텍스트적 신호가 상충하거나 메시지를 은폐하는 경우에도 인간의 사회적 가치와의 강력한 정렬을 이루지 못하고 있음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.