[논문 리뷰] Multimodal Analysis Of Google Bard And GPT-Vision: Experiments In Visual Reasoning
이 연구는 64개의 시각적 추론 작업을 통해 Google Bard와 GPT-Vision의 성능을 평가하여, 시각적 CAPTCHA 해결 및 시각적 텍스트 인식에서는 강점을 보였지만, 아스키 아트 재구성, 틱택토와 같은 구조적 격자 분석, 다음 장면 예측 등에서는 심각한 한계를 드러냈다. 이는 순수한 시각적 추측에 의존하는 것일 뿐, 견고한 시각적 이해 능력이 부족하다는 것을 시사한다.
Addressing the gap in understanding visual comprehension in Large Language Models (LLMs), we designed a challenge-response study, subjecting Google Bard and GPT-Vision to 64 visual tasks, spanning categories like "Visual Situational Reasoning" and "Next Scene Prediction." Previous models, such as GPT4, leaned heavily on optical character recognition tools like Tesseract, whereas Bard and GPT-Vision, akin to Google Lens and Visual API, employ deep learning techniques for visual text recognition. However, our findings spotlight both vision-language model's limitations: while proficient in solving visual CAPTCHAs that stump ChatGPT alone, it falters in recreating visual elements like ASCII art or analyzing Tic Tac Toe grids, suggesting an over-reliance on educated visual guesses. The prediction problem based on visual inputs appears particularly challenging with no common-sense guesses for next-scene forecasting based on current "next-token" multimodal models. This study provides experimental insights into the current capacities and areas for improvement in multimodal LLMs.
연구 동기 및 목표
- 최근의 다중모odal LLM, 특히 Google Bard와 GPT-Vision의 시각적 추론 능력을 이전 모델들인 GPT-4와 비교하여 조사하는 것.
- 시각적 특성 인식을 초월해 정확한 시각적 이해가 필요한 작업에서 비전-언어 모델의 한계를 규명하는 것.
- 아스키 아트나 체스판과 같은 시각적 패턴 재구성, 시각적 상황 추론, 다음 장면 예측 등의 작업에서 이 모델들의 성능을 평가하는 것.
- Bard와 GPT-Vision와 같은 모델들에 깊이 학습 기반의 시각적 이해 기능을 통합함으로써 순수하게 OCR에 의존하는 모델보다 향상된 추론 능력을 갖추었는지 평가하는 것.
제안 방법
- 64개의 다양한 시각적 추론 작업을 Google Bard와 GPT-Vision에 제시한 도전-응답 연구를 수행하였다.
- 맥락적 및 순차적 이해 능력을 평가하기 위해 '시각적 상황 추론'과 '다음 장면 예측' 등의 카테고리로 작업을 분류하였다.
- CAPTCHA, 아스키 아트, 틱택토 격자, 장면 전환 등의 시각적 입력을 제공하여 패턴 인식 및 구조적 추론 능력을 시험하였다.
- 외부 도구에 의존하지 않고 시각적 입력을 정확히 해석하고 설명하며 추론할 수 있는 능력을 평가하였다.
- 정확성과 일관성에 중점을 두어 모델 출력을 기준값과 비교함으로써 성능을 측정하였다.
- Tesseract와 같은 외부 OCR 도구를 사용한 이전 모델들인 GPT-4와의 결과를 대조하여 아키텍처 접근 방식의 변화를 부각시켰다.
실험 결과
연구 질문
- RQ1Google Bard와 GPT-Vision는 시각적 구조와 맥락 이해가 필요한 시각적 추론 작업에서 어떻게 성능을 보였는가?
- RQ2아스키 아트 재구성이나 격자 분석과 같은 작업에서 이 모델들이 정확한 시각적 이해보다는 시각적 추측에 얼마나 의존하는가?
- RQ3현재의 다중모달 입력을 바탕으로 시각적 시퀀스의 다음 장면을 효과적으로 예측할 수 있는가?
- RQ4Tesseract와 같은 외부 OCR 도구를 사용한 이전 모델들과 비교했을 때, 이들의 시각적 추론 능력은 어떻게 다를까?
- RQ5정확한 공간적 또는 구조적 추론이 필요한 작업에서 모델들이 시각적 추론에서 겪는 특정한 실패 유형은 무엇인가?
주요 결과
- Google Bard와 GPT-Vision는 단독으로는 해결할 수 없었던 ChatGPT의 시각적 CAPTCHA를 성공적으로 해결하여, 이전 모델들보다 향상된 시각적 인식 능력을 보였다.
- 아스키 아트 재구성 작업에서 심각한 어려움을 겪어, 시각적 패턴과 공간 배치에 대한 정확한 이해가 부족함을 확인했다.
- 틱택토 격자 분석 작업에서의 성능은 열악했으며, 이는 구조적이고 상징적인 시각적 레이아웃을 인식하고 추론하는 데에 한계가 있음을 드러냈다.
- 다음 장면 예측 작업에서는 신뢰할 수 있는 일반적 상식 추론이 이루어지지 않았으며, 모델들은 자주 잘못되거나 일관성이 없는 이어짐을 생성했다.
- 딥 러닝 기반의 시각적 텍스트 인식을 사용하고 있음에도 불구하고, 정확한 시각적 이해보다는 교육적 시각적 추측에 과도하게 의존하는 경향을 보였다.
- 이 연구는 현재의 다중모달 LLM이 여전히 강력한 시각적 추론 능력을 갖추지 못하고 있으며, 특히 구조적 또는 맥락적 추론이 필요한 작업에서 그 한계가 뚜렷하다는 것을 확인한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.