Skip to main content
QUICK REVIEW

[논문 리뷰] NewsCLIPpings: Automatic Generation of Out-of-Context Multimodal Media

Grace Luo, Trevor Darrell|arXiv (Cornell University)|2021. 04. 13.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

이 논문은 실제 뉴스 콘텐츠에서 유도된 자동 생성된 현실적인 비맥락적 이미지-캡션 쌍으로 구성된 대규모 데이터셋인 NewsCLIPpings를 소개한다. CLIP, SBERT-WK, Places365 임베딩을 활용하여 인간과 최첨단 모델을 혼란스럽게 하는 다중모odal 불일치를 생성함으로써, 위조 정보 확산을 위한 자동화된 이미지 재사용의 가능성과 위험성을 입증한다.

ABSTRACT

Online misinformation is a prevalent societal issue, with adversaries relying on tools ranging from cheap fakes to sophisticated deep fakes. We are motivated by the threat scenario where an image is used out of context to support a certain narrative. While some prior datasets for detecting image-text inconsistency generate samples via text manipulation, we propose a dataset where both image and text are unmanipulated but mismatched. We introduce several strategies for automatically retrieving convincing images for a given caption, capturing cases with inconsistent entities or semantic context. Our large-scale automatically generated NewsCLIPpings Dataset: (1) demonstrates that machine-driven image repurposing is now a realistic threat, and (2) provides samples that represent challenging instances of mismatch between text and image in news that are able to mislead humans. We benchmark several state-of-the-art multimodal models on our dataset and analyze their performance across different pretraining domains and visual backbones.

연구 동기 및 목표

  • 진정한 이미지가 잘못된 서사에 대한 근거로 악용되는 이미지 재사용의 증가하는 위협에 대응한다.
  • 이전 데이터셋이 텍스트 수정에 의존하여 단일모달 모델이 감지할 수 있는 언어적 단서를 포함한다는 한계를 극복한다.
  • 실제로 수정되지 않은 텍스트와 이미지만을 사용하여 도전적인 현실적인 이미지-캡션 불일치를 생성하는 방법을 개발한다.
  • 단일모달 편향을 제거함으로써 다중모달 분석을 필수적으로 만드는 벤치마크 데이터셋을 구축한다.
  • 최첨단 다중모달 모델의 이러한 불일치를 탐지하는 성능을 평가하고, 사전학습 도메인과 시각적 백본의 영향을 분석한다.

제안 방법

  • CLIP, SBERT-WK, Places365에서 유도된 ResNet-50 특징을 사용하여 캡션과 이미지 간의 의미적 및 시각적 유사도를 계산한다.
  • 네 가지 위협 시나리오를 설정한다: (a) 캡션-이미지 유사도, (b) 엔티티가 분리된 캡션-캡션 유사도, (c) 동일한 인물이지만 다른 맥락, (d) 동일한 장면이지만 다른 사건.
  • CLIP 기반의 적대적 필터링을 적용하여 쉽게 감지 가능한 쌍을 제거하고, 원본 쌍과 위조 쌍을 구별하는 난이도를 높인다.
  • 원본 저작권과 사용 권리를 유지하면서 VisualNews 코퍼스에서 NewsCLIPpings 데이터셋을 구성한다.
  • 검색 기반 매칭을 통해 실제 캡션과 의미적으로 유사하지만 맥락이 불일치하는 실제 이미지를 조합한다.
  • 인간 평가를 실시하여 생성된 위조 쌍의 현실성과 난이도를 검증한다.

실험 결과

연구 질문

  • RQ1기계 기반의 자동 이미지 재사용이 실제 이미지와 캡션을 사용하여 인간이 설득할 만한 비맥락적 뉴스 쌍을 생성할 수 있는가?
  • RQ2최첨단 다중모달 모델은 이러한 자동 생성된 불일치를 원본 쌍과 비교해 얼마나 효과적으로 탐지할 수 있는가?
  • RQ3다양한 사전학습 도메인과 시각적 백본은 다중모달 모델이 이미지-캡션 불일치를 탐지하는 데 있어 성능에 어떤 영향을 미치는가?
  • RQ4이 데이터셋에서 인간 평가자가 원본 쌍과 위조 쌍을 얼마나 어려움 없이 구별할 수 있는가?
  • RQ5성공적인 모델들이 이러한 적대적 예제에서 불일치를 탐지하기 위해 어떤 시각적 및 텍스트적 단서를 학습하는가?

주요 결과

  • NewsCLIPpings 데이터셋은 인간 평가를 통해 인간을 속이는 현실적이고 도전적인 비맥락적 이미지-캡션 쌍을 성공적으로 생성하였다.
  • 최첨단 다중모달 모델은 이 데이터셋에서 최적의 성능을 내지 못하며, 자동 이미지 재사용이 심각하고 인지되지 않은 위협임을 시사한다.
  • 다양한 도메인에서 사전학습된 모델과 강력한 시각적 백본을 사용한 모델는 성능 향상을 보였지만 여전히 제한되어 있어 더 견고한 다중모달 추론이 필요함을 보여준다.
  • CLIP 기반의 적대적 필터링은 쉽게 식별 가능한 불일치를 제거하여 탐지 작업의 난이도를 크게 높였다.
  • 정성적 분석을 통해 모델들이 불일치를 탐지하기 위해 물체의 맥락과 공간적 관계와 같은 미세한 시각적 주목 유도 단서에 의존하는 것으로 나타났다.
  • CLIP 및 SBERT-WK를 사용한 데이터셋 구축 과정은 인종, 성별, 장면 레이블링과 관련된 잠재적 편향을 유발할 수 있으며, 이는 인식되고 부분적으로 보완되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.