Skip to main content
QUICK REVIEW

[논문 리뷰] CoCoT: Contrastive Chain-of-Thought Prompting for Large Multimodal Models with Multiple Image Inputs

Daoan Zhang, Junming Yang|arXiv (Cornell University)|2024. 01. 05.
Multimodal Machine Learning Applications인용 수 4
한 줄 요약

CoCoT는 다중 이미지 간 유사성과 차이점을 명시적으로 비교하도록 유도하여 대규모 다중모态 모델의 이해력을 향상시키는 새로운 대비 체인오브thought 프롬프팅 방법이다. 이는 이미지 간 유사성과 차이점을 분석한 후 답변하도록 유도함으로써 다중 이미지 추론 작업에서 성능을 크게 향상시키며, GPT-4V 및 MMICL와 같은 오픈소스 및 클로즈드소스 모델 모두에서 최신 기술 수준의 성능을 달성한다.

ABSTRACT

When exploring the development of Artificial General Intelligence (AGI), a critical task for these models involves interpreting and processing information from multiple image inputs. However, Large Multimodal Models (LMMs) encounter two issues in such scenarios: (1) a lack of fine-grained perception, and (2) a tendency to blend information across multiple images. We first extensively investigate the capability of LMMs to perceive fine-grained visual details when dealing with multiple input images. The research focuses on two aspects: first, image-to-image matching (to evaluate whether LMMs can effectively reason and pair relevant images), and second, multi-image-to-text matching (to assess whether LMMs can accurately capture and summarize detailed image information). We conduct evaluations on a range of both open-source and closed-source large models, including GPT-4V, Gemini, OpenFlamingo, and MMICL. To enhance model performance, we further develop a Contrastive Chain-of-Thought (CoCoT) prompting approach based on multi-input multimodal models. This method requires LMMs to compare the similarities and differences among multiple image inputs, and then guide the models to answer detailed questions about multi-image inputs based on the identified similarities and differences. Our experimental results showcase CoCoT's proficiency in enhancing the multi-image comprehension capabilities of large multimodal models.

연구 동기 및 목표

  • 다중 이미지 간 세밀한 시각적 인식과 정보 융합 능력에 대한 대규모 다중모달 모델(LMMs)의 한계를 조사하는 것.
  • 다중 입력 간 공동 추론을 유도하는 효과적인 프롬프팅 전략의 부족을 해결하는 것.
  • 다중 이미지에서 세부적인 시각적 관계를 추출하고 요약할 수 있는 능력을 향상시키기 위한 프롬프팅 방법을 개발하는 것.
  • 제안된 방법의 효과성을 다양한 오픈소스 및 클로즈드소스 LMM들에 걸쳐 평가하는 것.

제안 방법

  • CoCoT는 두 단계의 프롬프팅 프로세스를 도입한다: 먼저 모델이 다중 입력 이미지 간의 유사성과 차이점을 식별한다.
  • 대비 추론을 활용하여 핵심적인 시각적 차이점을 부각시켜 정보 융합을 줄이고 관련 세부 정보에 집중하도록 한다.
  • 체인오브thought 추론을 시각적 대비와 융합하여 이미지 쌍에 대한 단계적 분석을 유도한다.
  • 微fine-tuning 없이도 적용 가능하므로 기존 LMM에 직접 구현할 수 있다.
  • GPT-4V, Gemini, OpenFlamingo, MMICL 등 다양한 LMM 아키텍처와 호환되도록 모듈러하게 설계되어 있다.
  • 유사성 및 차이점 프롬프팅 구성 요소의 기여도를 분리하기 위해 추론 분석(ablation study)을 수행한다.

실험 결과

연구 질문

  • RQ1여러 입력이 존재할 때 기존 대규모 다중모달 모델이 세밀한 시각적 세부 정보를 기반으로 이미지를 정확히 매칭할 수 있는가?
  • RQ2다중 이미지 간 대비 추론은 표준 체인오브thought 프롬프팅에 비해 다중 이미지 이해력 향상에 얼마나 기여하는가?
  • RQ3CoCoT는 다중모달 추론에서 정보 융합을 얼마나 줄이고 관련 시각적 차이점에 집중하는 데 효과적인가?
  • RQ4CoCoT의 성능 향상 효과는 다양한 오픈소스 및 클로즈드소스 LMM에 일반화되는가?
  • RQ5CoCoT 프롬프팅 프레임워크에서 유사성 식별과 차이점 식별 중 어느 것이 더 큰 기여를 하는가?

주요 결과

  • CoCoT는 다중 이미지-텍스트 매칭 정확도를 크게 향상시켜, MMICL에서는 77.00%, Gemini에서는 77.80%를 기록하며 베이스라인 방법을 능가한다.
  • GPT-4V에서는 그룹 점수가 37.75%에서 44.50%로 상승하여 이미지와 텍스트 이해 간 정렬성이 강화됨을 보여준다.
  • 추론 분석 결과, 유사성과 차이점 프롬프팅을 병합할 경우 가장 높은 성능을 기록하며, MMICL의 경우 양측 구성 요소를 모두 사용할 때 77.00%에 도달한다.
  • Gemini의 성능은 CoCoT 적용으로 25.00%에서 27.75%로 상승하지만, 다른 모델들에 비해 여전히 낮아 세밀한 시각적 정보 요약 능력에 한계가 있음을 시사한다.
  • OpenFlamingo와 MMICL는 CoCoT 적용으로 가장 두드러진 성능 향상을 보이며, 오픈소스 모델에서의 높은 호환성과 효과성을 입증한다.
  • 인간 성능은 여전히 높은 수준(85.50% 그룹 점수)을 유지하여 현재 모델과 인간 수준의 인식 능력 사이의 격차가 여전히 크다는 점을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.