Skip to main content
QUICK REVIEW

[논문 리뷰] Visually-Augmented Language Modeling

Weizhi Wang, Dong Li|arXiv (Cornell University)|2022. 05. 20.
Multimodal Machine Learning Applications인용 수 5
한 줄 요약

이 논문은 검색된 이미지를 통합하여 사전 훈련된 언어 모델의 시각적 공통지식 추론 능력을 향상시키는 시각적 보강 언어 모델링 프레임워크인 VaLM을 제안한다. CLIP 기반의 이미지 검색 모듈과 텍스트-이미지 동시 주의를 위한 시각적 지식 융합층을 사용함으로써, VaLM는 시각 지식 집약적 과제에서 최신 기술 수준(SOTA) 성능을 달성하며, MemoryColor, RelativeSize, ObjectShape에서 각각 +14.50%, +17.80%, +11.68%의 성능 향상을 기록한다.

ABSTRACT

Human language is grounded on multimodal knowledge including visual knowledge like colors, sizes, and shapes. However, current large-scale pre-trained language models rely on text-only self-supervised training with massive text data, which precludes them from utilizing relevant visual information when necessary. To address this, we propose a novel pre-training framework, named VaLM, to Visually-augment text tokens with retrieved relevant images for Language Modeling. Specifically, VaLM builds on a novel latent text-image alignment method via an image retrieval module to fetch corresponding images given a textual context. With the visually-augmented context, VaLM uses a visual knowledge fusion layer to enable multimodal grounded language modeling by attending to both text context and visual knowledge in images. We evaluate VaLM on various visual knowledge-intensive commonsense reasoning tasks, which require visual information to excel. The experimental results illustrate that VaLM outperforms all strong language-only and vision-language baselines with substantial gains in reasoning object commonsense including color, size, and shape. Our code is available at https://github.com/Victorwz/VaLM.

연구 동기 및 목표

  • 사전 훈련된 언어 모델의 시각적 기반 부족으로 인한 환각 문제를 해결하기 위해 훈련 단계에서 시각적 지식을 통합하는 것.
  • 추론 단계에서 이미지-텍스트 데이터 쌍이 필요 없이 사전 훈련된 언어 모델이 효과적으로 시각 정보를 활용할 수 있도록 하는 것.
  • 텍스트 토큰과 관련된 이미지 간의 유연하고 실시간(온더플라이) 정렬 메커니즘을 설계하여 맥락 이해를 향상시키는 것.
  • 색상, 크기, 형태와 같은 물체 특성에 대한 추론을 다중모달 융합을 통해 향상시키는 것.

제안 방법

  • 사전 훈련 텍스트 코퍼스의 각 토큰에 대해 k개의 근접한 이웃 이미지를 검색하는 CLIP 기반의 이미지 검색 모듈을 사용하여 텍스트 맥락의 시각적 보강을 구현한다.
  • 텍스트 토큰과 검색된 이미지 간의 동시 자기주의를 가능하게 하는 시각적 지식 융합층을 도입하며, 이미지 전용 주의 키와 값에 대해 별도의 선형 투영을 사용한다.
  • 주의 투영을 위한 공통 맥락 가중치 행렬을 사용하며, 효율성과 성능 향상을 위해 오직 이미지 전용 바이어스만 추가한다.
  • 모델은 엔드 투 엔드의 사전 훈련 및 미세조정을 지원하며, 추론 중에 동적으로 시각 지식을 통합할 수 있도록 한다.
  • CLIP에서 캐시된 이미지 임베딩을 사용하여 이미지 검색을 수행함으로써 통합된 텍스트-이미지 임베딩 공간에서 확장 가능하고 효율적인 검색을 가능하게 한다.
  • 아키텍처는 자동회귀 언어 모델과 호환되며, 인코더 전용 또는 인코더-디코더 백본으로도 확장 가능하다.

실험 결과

연구 질문

  • RQ1검색된 이미지를 통한 언어 모델 보강이 색상, 크기, 형태와 같은 시각적 공통지식 성질에 대한 추론 능력을 향상시키는 데 효과적인가?
  • RQ2온더플라이 이미지 검색 방식이 감독 기반의 시각-언어 사전 훈련 방식과 비교해 영향 없이 추론 성능에서 어떻게 다를까?
  • RQ3과도한 파rameter 수를 유발하지 않으면서도 시각적 특징을 언어 모델의 주의 메커니즘에 최적으로 융합하는 방법은 무엇인가?
  • RQ4시각 지식 통합이 언어 모델 예측에서 환각 현상을 줄이는가?
  • RQ5제안된 프레임워크는 시각적 공통지식 추론을 넘어 일반 자연어 이해 과제의 성능 향상에도 기여하는가?

주요 결과

  • VaLM는 강력한 기준 모델 대비 MemoryColor 데이터셋에서 +14.50%의 절대 정확도 향상을 기록하며, 물체 색상에 대한 추론 능력 향상이 뚜렷하게 입증된다.
  • RelativeSize 벤치마크에서 VaLM는 +17.80% 향상되며, 상대적 물체 크기에 대한 추론 성능이 뛰어나다는 것을 보여준다.
  • ObjectShape 데이터셋에서 VaLM는 +11.68% 향상되며, 형태 관련 공통지식 지식 모델링이 효과적이라는 것을 시사한다.
  • 제거 실험 결과, 주의 투영에 이미지 전용 바이어스를 도입할 경우 가중치 공유나 전체 이미지 전용 투영을 사용하는 것보다 성능이 뛰어나다는 것이 확인된다.
  • 다양한 시각 지식 집약적 추론 과제에서 언어 전용 및 시각-언어 사전 훈련 모델을 모두 압도하는 성능을 기록한다.
  • VaLM는 일반 자연어 이해 과제의 성능 향상에도 기여하며, 시각적 공통지식을 넘어 보다 광범위한 이점이 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.