Skip to main content
QUICK REVIEW

[논문 리뷰] CLIP-Event: Connecting Text and Images with Event Structures

Manling Li, Ruochen Xu|arXiv (Cornell University)|2022. 01. 13.
Multimodal Machine Learning Applications인용 수 8
한 줄 요약

CLIP-Event는 문맥 정보 추출 및 프롬프트 엔지니어링을 통해 하드 네거티브를 생성함으로써 이벤트 구조(이벤트 유형 및 역할 역할)를 통합하는 대비 학습 프레임워크를 제안한다. 이는 다중모态 이벤트 이해에서 SOTA(최고성능)의 zero-shot 성능을 달성하며, 이벤트 추출에서 이전 모델보다 F-스코어 기준 5퍼센트 이상 향상되었고, 다양한 후행 작업에서 뚜렷한 성능 향상을 보였다.

ABSTRACT

Vision-language (V+L) pretraining models have achieved great success in supporting multimedia applications by understanding the alignments between images and text. While existing vision-language pretraining models primarily focus on understanding objects in images or entities in text, they often ignore the alignment at the level of events and their argument structures. In this work, we propose a contrastive learning framework to enforce vision-language pretraining models to comprehend events and associated argument (participant) roles. To achieve this, we take advantage of text information extraction technologies to obtain event structural knowledge, and utilize multiple prompt functions to contrast difficult negative descriptions by manipulating event structures. We also design an event graph alignment loss based on optimal transport to capture event argument structures. In addition, we collect a large event-rich dataset (106,875 images) for pretraining, which provides a more challenging image retrieval benchmark to assess the understanding of complicated lengthy sentences. Experiments show that our zero-shot CLIP-Event outperforms the state-of-the-art supervised model in argument extraction on Multimedia Event Extraction, achieving more than 5% absolute F-score gain in event extraction, as well as significant improvements on a variety of downstream tasks under zero-shot settings.

연구 동기 및 목표

  • 이미지와 텍스트에서 이벤트 수준의 의미론적 구조와 역할 역할 구조를 간과하는 비전-언어 사전학습 모델의 격차를 보완하기 위해.
  • 캡션화된 뉴스 데이터로부터 원거리 지도 학습을 활용하여 zero-shot 다중모달 이벤트 이해를 향상시키기 위해.
  • 자기지도 대비 학습을 통해 미리 보지 않은 이벤트 유형과 역할 역할을 강력하게 식별할 수 있도록 하기 위해.
  • 최적의 운반 이론을 사용하여 비전과 언어 모odal 간의 이벤트 역할 구조 정렬을 명시적으로 모델링하기 위해.

제안 방법

  • 이미지 캡션에서 이벤트 유형, 촉발자, 역할 역할을 자동으로 추출하는 텍스트 정보 추출 도구를 활용하여 약한 지도 학습을 제공한다.
  • 다양한 프롬프트 함수를 사용하여 이벤트 구조를 조작함으로써 하드 네거티브 기술 설명을 생성한다(예: 역할 역할을 교환하거나 이벤트 유형을 변경함).
  • 이미지 특징과 이벤트 인식 텍스트 기술 설명 간의 대비 학습 목표를 학습하여 비전과 언어 표현을 정렬한다.
  • 이미지 객체와 텍스트 엔터티의 역할 역할을 포함한 이벤트 그래프를 구축하고, 최적의 운반 이론을 사용하여 이러한 그래프를 전역적으로 정렬함으로써 세밀한 구조 전달을 실현한다.
  • 이미지-텍스트 정렬과 이벤트 그래프 정렬을 통합된 랭킹 메커니즘으로 통합하여 후행 작업에 활용한다.
  • 복잡한 장문 문장 이해를 지원하기 위해 뉴스 자료에서 유래한 106,875장의 이미지로 구성된 대규모 이벤트 풍부 데이터셋에서 사전학습한다.

실험 결과

연구 질문

  • RQ1객체 및 실체 인식을 넘어서 이벤트 수준의 의미론적 이해를 향상시킬 수 있는가?
  • RQ2자기지도 대비 학습을 통해 텍스트에서 추출한 이벤트 구조 지식(이벤트 유형 및 역할 역할)을 어떻게 비전에 효과적으로 전달할 수 있는가?
  • RQ3모델이 미리 보지 않은 이벤트 유형과 역할 역할에 대해 zero-shot 이벤트 추출 및 역할 역할 인식에 얼마나 잘 일반화할 수 있는가?
  • RQ4최적의 운반 이론을 통한 명시적 이벤트 그래프 정렬은 복잡한 이벤트 구조의 다중모달 이해를 얼마나 향상시키는가?
  • RQ5이벤트 구조 지식 통합이 영상-언어 후행 작업(예: 기반 상황 인식 및 시각적 공통지식 추론)에서 뛰어난 성능 향상에 기여하는가?

주요 결과

  • CLIP-Event는 다중모달 이벤트 추출 벤치마크에서 가장 강력한 지도 학습 기반 모델 대비 zero-shot 설정에서 F-스코어 기준 5.1%p의 절대적 향상을 달성했다.
  • VOANews 데이터셋에서 이미지 검색 성능은 R@1 기준 3.7%p 향상되고 R@5 기준 2.1%p 향상되었으며, 뉴스 데이터로 사전학습된 CLIP보다 우수했다.
  • 제거 실험 결과, 최적의 운반 이론을 제거할 경우 VOANews에서 R@1이 2.0%p 감소함을 확인하여, 이는 구조 정렬에서의 중요성을 입증했다.
  • CLIP 및 뉴스 데이터로 사전학습된 CLIP보다 모든 평가 벤치마크에서 zero-shot 설정에서 성능이 뛰어났다. 이는 VCR 및 VisualCOMET을 포함한 다양한 벤치마크에서 동일하게 성립했다.
  • 모델는 오픈월드 이벤트에 대해 강력한 일반화 능력을 보였으며, 자연어 기술 설명만으로도 이전에 본 적 없는 유형과 역할을 포함한 이벤트 구조를 성공적으로 식별했다.
  • 이벤트 유형 분포 분석 결과, 추출된 이벤트는 주로 시각적으로 탐지 가능한 것으로 확인되어, 실세계 다중모달 응용에 대한 훈련 데이터의 관련성을 검증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.