Skip to main content
QUICK REVIEW

[논문 리뷰] TouchStone: Evaluating Vision-Language Models by Language Models

Shuai Bai, Shusheng Yang|arXiv (Cornell University)|2023. 08. 31.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 다양한 능력을 갖춘 시각어휘 모델(LVLMs)을 평가하기 위해 대규모 언어 모델(LLMs)을 심판으로 사용하는 자동 평가 프레임워크인 TouchStone을 제안한다. 다각적 이미지 설명을 통해 다중모달 입력을 텍스트로 변환함으로써, GPT-4가 인간의 선호도와 높은 일치를 이룰 수 있도록 대화 품질을 평가할 수 있게 되었으며, 이는 현재 LVLMs에서 심각한 환각 현상을 드러내고 향상이 필요한 핵심 영역을 특정한다.

ABSTRACT

Large vision-language models (LVLMs) have recently witnessed rapid advancements, exhibiting a remarkable capacity for perceiving, understanding, and processing visual information by connecting visual receptor with large language models (LLMs). However, current assessments mainly focus on recognizing and reasoning abilities, lacking direct evaluation of conversational skills and neglecting visual storytelling abilities. In this paper, we propose an evaluation method that uses strong LLMs as judges to comprehensively evaluate the various abilities of LVLMs. Firstly, we construct a comprehensive visual dialogue dataset TouchStone, consisting of open-world images and questions, covering five major categories of abilities and 27 subtasks. This dataset not only covers fundamental recognition and comprehension but also extends to literary creation. Secondly, by integrating detailed image annotations we effectively transform the multimodal input content into a form understandable by LLMs. This enables us to employ advanced LLMs for directly evaluating the quality of the multimodal dialogue without requiring human intervention. Through validation, we demonstrate that powerful LVLMs, such as GPT-4, can effectively score dialogue quality by leveraging their textual capabilities alone, aligning with human preferences. We hope our work can serve as a touchstone for LVLMs' evaluation and pave the way for building stronger LVLMs. The evaluation code is available at https://github.com/OFA-Sys/TouchStone.

연구 동기 및 목표

  • 시각어휘 모델(LVLMs)에 대한 종합적이고 자동화된 평가의 부족, 특히 대화 및 창작 능력에 초점을 맞춘다.
  • 인간 평가의 한계를 극복하기 위해 강력한 LLM을 심판으로 사용하는 확장 가능한 자동화된 방법을 개발한다.
  • 세밀한 인간 설명과의 비교를 통해 LVLMs의 환각 현상을 체계적으로 평가한다.
  • 인식, 이해, 문학적 창작을 포함한 다양한 능력을 다루는 개방형 시각 대화 데이터셋을 구축한다.
  • 인간 애너테이터나 시각 증강 모델 없이도 직접적이고 효율적이며 신뢰할 수 있는 LVLM 성능 평가를 가능하게 한다.

제안 방법

  • 기본 능력 카테고리 5개(기술표현, 인식, 이해, 서사, 다중이미지 분석)에 걸쳐 총 27개의 하위 작업을 포함하는 TouchStone 데이터셋을 구축한다.
  • 시각 입력을 LLM이 이해할 수 있는 텍스트 형식으로 변환하기 위해 세밀한 이미지 애너테이션과 설명을 생성한다.
  • 정확성, 관련성, 유용성 기반의 쌍대 비교를 통해 대화 품질을 평가하기 위해 GPT-4를 심판 모델로 사용한다.
  • 세밀한 이미지 애너테이션과 질문에서 유도된 GPT-4-HA(인간 보조) 응답을 기준 출력으로 사용한다.
  • 쌍대 비교에서의 위치 편향을 완화하기 위해 위치 균형 잡힌 점수 체계를 구현한다.
  • 모델이 생성한 설명과 인간 애너테이션을 GPT-4에 입력하여 환각 심각도를 예측함으로써 환각을 측정한다.

실험 결과

연구 질문

  • RQ1GPT-4와 같은 강력한 LLM이 인간의 간섭 없이 다중모달 대화의 품질 평가에 신뢰할 수 있는 심판으로 기능할 수 있는가?
  • RQ2현재 LVLMs는 어느 정도의 수준으로 환각을 보이며, LLM 기반 평가를 통해 이를 정량적으로 측정할 수 있는가?
  • RQ3LVLMs는 인간 선호도와 비교해 볼 때 다양한 능력, 특히 시각적 서사와 다중이미지 추론 능력에서 얼마나 잘 수행되는가?
  • RQ4입력 이미지 해상도와 프롬프트 설계는 LVLMs의 환각을 줄이는 데 어떤 역할을 하는가?
  • RQ5LLM 심판을 사용한 자동 평가가 인간 선호도 순위와 강한 일치를 이룰 수 있는가?

주요 결과

  • GPT-4를 심판으로 사용할 경우 대화 품질 평가에서 인간 선호도와 높은 일치를 보이며, 자동화된 LLM 기반 평가의 가능성을 입증한다.
  • PandaGPT는 가장 높은 환각 점수(835.5)를 기록하여 심각한 환각을 보이며, 이는 주로 시각 입력이 제한적일 경우(예: ImageBind의 cls 임베딩만 제공)일 가능성이 높다.
  • InstructBLIP과 Qwen-VL는 가장 낮은 환각 점수(519.0 및 504.5)를 기록하여, 더 짧고 간결한 응답이 환각 위험을 줄이는 데 기여함을 시사한다.
  • 현재 LVLMs는 공간적 이해력과 복잡한 시각적 관계를 다루는 데 어려움을 겪고 있어, 향후 더 나은 공간적 및 구조적 모델링이 필요하다.
  • 224×224를 초월하는 고해상도 이미지 입력은 세밀한 세부 사항과 작은 물체의 인식을 향상시켜 출력 정확도를 높일 수 있다.
  • 웹페이지, 기사 등과 같은 혼합된 이미지-텍스트 데이터를 활용한 다중이미지 사전학습은 여러 이미지 간 추론 및 요약 능력을 향상시킬 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.