[논문 리뷰] From Images to Textual Prompts: Zero-shot VQA with Frozen Large Language Models
이 논문은 이미지로부터 생성된 합성 이미지 설명과 해당 설명에 대응하는 질문-답변 페어를 프롬프트로 사용하여 동결된 대규모 언어 모델(Langauge Models, LLMs)이 제로샷 시각질문응답(Visual Question Answering, VQA)을 수행할 수 있도록 하는 플러그 앤 플레이 모듈 Img2LLM를 제안한다. 이 방법은 종단간 최적화나 전용 훈련 없이도 최신 기술 수준의 제로샷 VQA 성능을 달성하며, VQAv2에서 Flamingo보다 5.6% 높고, A-OKVQA에서 소수의 예시를 사용하는 방법보다 최대 20% 높은 성능을 기록한다.
Large language models (LLMs) have demonstrated excellent zero-shot generalization to new language tasks. However, effective utilization of LLMs for zero-shot visual question-answering (VQA) remains challenging, primarily due to the modality disconnection and task disconnection between LLM and VQA task. End-to-end training on vision and language data may bridge the disconnections, but is inflexible and computationally expensive. To address this issue, we propose \emph{Img2Prompt}, a plug-and-play module that provides the prompts that can bridge the aforementioned modality and task disconnections, so that LLMs can perform zero-shot VQA tasks without end-to-end training. In order to provide such prompts, we further employ LLM-agnostic models to provide prompts that can describe image content and self-constructed question-answer pairs, which can effectively guide LLM to perform zero-shot VQA tasks. Img2Prompt offers the following benefits: 1) It can flexibly work with various LLMs to perform VQA. 2)~Without the needing of end-to-end training, it significantly reduces the cost of deploying LLM for zero-shot VQA tasks. 3) It achieves comparable or better performance than methods relying on end-to-end training. For example, we outperform Flamingo \cite{Deepmind:Flamingo2022} by 5.6\% on VQAv2. On the challenging A-OKVQA dataset, our method even outperforms few-shot methods by as much as 20\%.
연구 동기 및 목표
- 동결된 LLM을 사용할 때 시각과 언어 간의 모odal 및 작업 불일치 문제를 해결하기 위해.
- 시각-언어 모델의 고비용 종단간 최적화가 필요 없도록 하기 위해.
- 시각 이해와 언어 생성을 분리함으로써 LLM의 영구적이고 저비용의 VQA 배포를 가능하게 하기 위해.
- 소수의 예시 데이터에 의존하지 않고 제로샷 VQA 일반화 성능을 향상시키기 위해.
제안 방법
- Img2LLM는 시각-언어 모델(예: BLIP)과 질문 생성 모델을 사용하여 테스트 이미지와 질문으로부터 합성된 이미지 설명과 해당하는 질문-답변 페어를 생성한다.
- 생성된 합성 QA 페어는 입력 질문에 대한 응답을 유도하기 위해 동결된 LLM에 프롬프트로 사용된다.
- 이 방법은 각 테스트 샘플마다 동적으로 프롬프트를 생성하여 정적 소수의 예시에 의존하지 않는다.
- 전체 설명을 먼저 연결하고, 그 다음에 전체 QA 페어를 연결하는 CCC-QAQAQA 형식의 프롬프트 설계가 교차 배치된 설계보다 성능이 뛰어나다.
- 품질 향상과 노이즈 감소를 위해 빈도 기반 필터링을 활용해 설명 선택을 최적화한다.
- 이 방법은 LLM에 종속되지 않으며, 어떤 오프더쇼프 LLM과도 플러그 앤 플레이 통합이 가능하다.
실험 결과
연구 질문
- RQ1동결된 LLM이 종단간 최적화 없이도 합성 시각 프롬프트를 활용하여 제로샷 VQA를 수행할 수 있는가?
- RQ2프롬프트 설계(예: CCC-QAQAQA 대비 CQA-CQA-CQA)는 VQA 성능에 어떤 영향을 미치는가?
- RQ3이미지와 질문에 따라 동적으로 생성된 합성 QA 페어는 제로샷 환경에서 정적 소수의 예시보다 성능이 뛰어나게 되는가?
- RQ4설명 선택 전략(예: 최대/최소 빈도)은 프롬프트 품질과 최종 VQA 정확도에 어떤 영향을 미치는가?
- RQ5Flamingo와 같은 종단간 훈련된 모델과 비교해 본다면, 이 방법은 제로샷 VQA 벤치마크에서 어떤 성능을 보이는가?
주요 결과
- Img2LLM는 VQAv2 검증 세트에서 OPT-30B를 사용해 59.5%의 정확도로 Flamingo를 5.6% 뛰어넘었다.
- 도전적인 A-OKVQA 벤치마크에서 Img2LLM는 소수의 예시를 사용하는 방법보다 최대 20% 높은 정확도를 기록했다.
- CCC-QAQAQA 프롬프트 설계는 CQA-CQA-CQA보다 뚜렷하게 뛰어나며, VQAv2에서 59.5%의 정확도, OK-VQA에서 41.8%의 정확도를 달성했다.
- 질문과 관련된 설명을 필터링하여 사용할 경우, VQAv2에서 59.5%의 정확도, OK-VQA에서 41.8%의 정확도를 기록했으며, 전체 이미지 설명을 사용할 경우 57.1%와 39.8%로 성능이 떨어졌다.
- 이 방법은 A100 GPU에서 추론 오버헤드를 24.4%로 줄여, Flamingo와 같은 종단간 훈련의 500K+ TPU 시간 소모를 피했다.
- 제거 실험 결과, 프롬프트 설계와 설명 선택 전략이 성능에 크게 영향을 미치며, 최소 빈도 기반의 설명 선택 전략이 성능 향상에 기여하는 것으로 확인되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.