Skip to main content
QUICK REVIEW

[논문 리뷰] Plug-and-Play VQA: Zero-shot VQA by Conjoining Large Pretrained Models with Zero Training

Anthony Meng Huat Tiong, Junnan Li|arXiv (Cornell University)|2022. 10. 17.
Multimodal Machine Learning Applications인용 수 6
한 줄 요약

PnP-VQA는 추가 학습 없이도 제로샷 시각질문응답을 구현하는 플러그 앤 플레이 프레임워크로, 사전 훈련된 시각-언어 모델, 질문 유도 캡션 모듈, 사전 훈련된 언어 모델을 결합한다. 네트워크 해석 가능성 기반으로 유의미하고 답변 관련 캡션을 생성하고, 이를 디코더에 융합함으로써 최신 기술 수준의 성능을 달성한다. VQAv2에서 Flamingo(80B)를 8.5% 이상, GQA에서 FewVLM을 9.1% 초월하여 성능을 뛰어넘으며, 기초 모델의 모듈화되고 훈련 없이 통합하는 방식의 잠재력을 입증한다.

ABSTRACT

Visual question answering (VQA) is a hallmark of vision and language reasoning and a challenging task under the zero-shot setting. We propose Plug-and-Play VQA (PNP-VQA), a modular framework for zero-shot VQA. In contrast to most existing works, which require substantial adaptation of pretrained language models (PLMs) for the vision modality, PNP-VQA requires no additional training of the PLMs. Instead, we propose to use natural language and network interpretation as an intermediate representation that glues pretrained models together. We first generate question-guided informative image captions, and pass the captions to a PLM as context for question answering. Surpassing end-to-end trained baselines, PNP-VQA achieves state-of-the-art results on zero-shot VQAv2 and GQA. With 11B parameters, it outperforms the 80B-parameter Flamingo model by 8.5% on VQAv2. With 738M PLM parameters, PNP-VQA achieves an improvement of 9.1% on GQA over FewVLM with 740M PLM parameters. Code is released at https://github.com/salesforce/LAVIS/tree/main/projects/pnp-vqa

연구 동기 및 목표

  • 사전 훈련된 언어 모델의 미세조정이나 아키텍처 수정 없이 제로샷 시각질문응답을 가능하게 하기 위해.
  • 사용 가능한 사전 훈련된 컴포onent들만을 사용하여 제로샷 환경에서 시각과 언어 모odal 간의 다리를 놓는 도전 과제를 해결하기 위해.
  • 재학습 없이도 시각 및 언어 기초 모델의 최신 발전을 동적으로 통합할 수 있는 모듈러하고 유연한 프레임워크를 개발하기 위해.
  • 중간 표현으로서의 정보성 있고 질문 관련 캡션을 활용하여 VQA 벤치마크 성능을 향상시키기 위해.

제안 방법

  • 입력 질문에 관련된 이미지 캡션을 생성하기 위해 사전 훈련된 시각-언어 모델(BLIP)을 활용한다.
  • 질문과 관련된 이미지 패치를 식별하기 위해 Grad-CAM 기반 네트워크 해석 가능성 기법을 적용한다.
  • 질문 관련 이미지 패치에서 시각 인코더와 디코더를 사용해 다양한 무작위 캡션을 생성한다.
  • 생성된 캡션을 바탕으로 질문에 답하기 위해 사전 훈련된 언어 모델(UnifiedQAv2)을 활용한다.
  • 최대 100개의 질문 유도 캡션을 융합하여 답변 생성 성능을 향상시키기 위해 디코더 내 융합 기법을 사용한다.
  • 추가 학습이나 아키텍처 변경 없이 사전 훈련된 모델의 추론에만 의존한다.

실험 결과

연구 질문

  • RQ1추가 미세조정이나 아키텍처 수정 없이도 사용 가능한 사전 훈련된 모델들만을 사용해 제로샷 VQA 시스템을 구축할 수 있는가?
  • RQ2자연어와 네트워크 해석 가능성 기반 인터페이스를 통해 시각 모델과 언어 모델을 연결하는 방식이 VQA에 얼마나 효과적인가?
  • RQ3일반적인 캡션과 비교해 질문 유도적이고 정보성 있는 이미지 캡션은 제로샷 VQA 성능을 얼마나 향상시킬 수 있는가?
  • RQ4생성된 캡션의 수가 플러그 앤 플레이 환경에서 답변 정확도와 모델의 강건성에 어떤 영향을 미치는가?
  • RQ5모듈러하고 훈련 없이 통합된 프레임워크가 Flamingo나 FewVLM과 같은 엔드 투 엔드 학습된 모델을 제로샷 VQA 벤치마크에서 능가할 수 있는가?

주요 결과

  • 11B 파라미터를 가진 PnP-VQA는 VQAv2에서 63.3%의 정확도를 기록하며, 80B 파라미터를 가진 Flamingo 모델을 8.5% 이상 앞서며 성능을 뛰어넘었다.
  • GQA 벤치마크에서 PnP-VQA(738M 파라미터)는 41.9%의 정확도를 기록하여, 740M 파라미터를 가진 FewVLM을 9.1% 초월했다.
  • 질문 유도 캡션 사용으로 캡션 수가 20에서 100으로 증가함에 따라 답변 환상률(AHR)이 71.8%에서 84.0%로 상승하여 답변의 관련성이 높아지는 것으로 나타났다.
  • 무작위성 있는 캡션 디코딩 방법(예: nucleus sampling)이 반복적이고 다양성이 떨어지는 더불어 검색 방식보다 우수한 성능을 보였다.
  • 질문-답변 모델의 선택이 성능에 큰 영향을 미치며, 일반 목적 모델(T0, GPT-J)보다 작업 특화 모델인 UnifiedQAv2가 훨씬 뛰어난 성능을 보였다.
  • 이 프레임워크는 엔드 투 엔드 학습 없이도 사전 훈련된 모델의 모듈러 조합을 통해 제로샷 VQA에서 높은 성능을 달성할 수 있음을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.