Skip to main content
QUICK REVIEW

[논문 리뷰] IdealGPT: Iteratively Decomposing Vision and Language Reasoning via Large Language Models

Haoxuan You, Zhecan Wang|arXiv (Cornell University)|2023. 05. 24.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

IdealGPT는 시각-언어 추론을 다중 라운드의 하위질문 생성, VLM를 통한 시각적 답변 검색, 다단계 추론으로 분해하는 반복적이고 LLM 기반의 프레임워크를 제안한다. 이는 제로샷 추론 성능을 향상시키기 위한 것이다. VCR에서 최신의 GPT-4 유사 모델보다 10% 높은 정확도를 달성하고, SNLI-VE에서는 15% 향상되었다. 이는 신뢰도 기반의 동적 반복을 통해 신뢰할 수 있는 답변에 도달할 때까지 진행된다.

ABSTRACT

The field of vision-and-language (VL) understanding has made unprecedented progress with end-to-end large pre-trained VL models (VLMs). However, they still fall short in zero-shot reasoning tasks that require multi-step inferencing. To achieve this goal, previous works resort to a divide-and-conquer pipeline. In this paper, we argue that previous efforts have several inherent shortcomings: 1) They rely on domain-specific sub-question decomposing models. 2) They force models to predict the final answer even if the sub-questions or sub-answers provide insufficient information. We address these limitations via IdealGPT, a framework that iteratively decomposes VL reasoning using large language models (LLMs). Specifically, IdealGPT utilizes an LLM to generate sub-questions, a VLM to provide corresponding sub-answers, and another LLM to reason to achieve the final answer. These three modules perform the divide-and-conquer procedure iteratively until the model is confident about the final answer to the main question. We evaluate IdealGPT on multiple challenging VL reasoning tasks under a zero-shot setting. In particular, our IdealGPT outperforms the best existing GPT-4-like models by an absolute 10% on VCR and 15% on SNLI-VE. Code is available at https://github.com/Hxyou/IdealGPT

연구 동기 및 목표

  • 제로샷 다단계 추론 작업에서 종단간 시각-언어 모델의 한계를 해결하기 위해.
  • 사용자 정의 하위질문 모델에 대한 의존성과 단일 라운드 추론에서 충분한 증거가 존재한다는 가정을 극복하기 위해.
  • 반복적이고 신뢰도 기반의 정교화를 통해 시각-언어 추론의 해석 가능성, 모odularity, 내성적 강도를 향상시키기 위해.
  • 충분한 시각적 및 언어적 증거가 수집될 때까지 최종 답변을 연기하여 환상적 예측과 허위 예측을 줄이기 위해.

제안 방법

  • IdealGPT는 세 개의 LLM 에이전트를 사용한다: 하위질문을 생성하는 Questioner, 시각적 답변을 제공하는 Answerer(사전 훈련된 VLM), 증거 평가 및 추가 반복 유도를 담당하는 Reasoner.
  • 프레임워크는 반복적으로 작동한다: Reasoner가 자신감이 없을 경우, Questioner에게 더 구체적인 하위질문을 생성하도록 요청하여 새로운 라운드를 시작한다.
  • 각 반복 과정에서 새로운 하위답변이 수집되며, Reasoner는 이들의 일관성과 충분성을 평가한 후 계속 진행할지 또는 종료할지 결정한다.
  • Reasoner가 최종 답변에 자신감을 갖거나 최대 반복 횟수에 도달할 때까지 이 과정이 반복된다.
  • 시스템은 Questioner와 Reasoner로 GPT-4를 사용하고, Answerer로 BLIP-2를 사용하며, 일관성과 명확성을 확보하기 위해 수동으로 설계된 프롬프트를 사용한다.
  • 이 방법은 모듈러하며, 성능 향상을 위해 구성 요소를 더 강력한 LLM이나 VLM로 교체할 수 있다.

실험 결과

연구 질문

  • RQ1반복적이고 LLM 기반의 분해가 단일 단계 종단간 모델을 초월해 제로샷 시각-언어 추론을 향상시킬 수 있는가?
  • RQ2신뢰도 기반 반복이 환상적 예측을 줄이고 시각-언어 작업의 추론 내성적 강도를 향상시키는가?
  • RQ3Answerer로 사용된 VLM의 선택이 반복 프레임워크 내 성능에 어떤 영향을 미치는가?
  • RQ4생성된 이미지 캡션의 품질이 하위질문 생성과 최종 추론에 어느 정도 영향을 미치는가?
  • RQ5동적 피드백 루프를 갖춘 모듈러하고 다중 에이전트 프레임워크가 복잡한 추론 작업에서 고정형 파이프라인 또는 종단간 VLM보다 우수한 성능을 낼 수 있는가?

주요 결과

  • IdealGPT는 제로샷 설정에서 기존 최고의 GPT-4 유사 모델보다 VCR 벤치마크에서 절대 10% 높은 정확도를 달성한다.
  • IdealGPT는 제로샷 평가에서 최신 기술의 모델보다 SNLI-VE 벤치마크에서 절대 15% 향상된 성능을 보였다.
  • 반복적 분해 메커니즘이 단일 패assing(최대 반복 수=1) 설정 대비 정확도를 최대 6% 향상시켰으며, 샘플당 평균 1.8회의 반복을 수행했다.
  • BLIP-2는 더 강력한 캡션 생성 능력을 지닌 MiniGPT4와 LLaVA보다 하위답변 생성 시 환상률이 낮아 Answerer로써 더 우수한 성능을 보였다.
  • MiniGPT4와 LLaVA는 더 길고 더 정보가 풍부한 캡션을 생성하지만, 정확도는 떨어지며, 이는 Questioner와 Reasoner를 오도하여 전체 성능을 떨어뜨린다.
  • 제거 분석 결과, 이미지 캡션의 품질이 후속 추론에 상당한 영향을 미치며, 더 짧고 보수적인 캡션은 더 좋은 결과를 낳는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.