[논문 리뷰] What Makes for Good Visual Instructions? Synthesizing Complex Visual Reasoning Instructions for Visual Instruction Tuning
이 논문은 다중모달 대규모 언어모델(MLLM)을 위한 효과적인 시각적 지시의 핵심 요소를 탐구하며, 복잡한 시각적 추론 작업이 성능을 크게 향상시킨다는 것을 발견한다. 저자들은 자동으로 32,000개의 고품질 복잡한 시각적 추론 지시(ComVint)를 생성하기 위해 '합성-복잡화-다시정의' 프레임워크를 제안한다. 이는 MLLM 성능을 일관되게 향상시키며, 예를 들어 MiniGPT-4와 BLIP-2의 MME-Cognition 성능을 각각 32.6%와 28.8% 향상시킨다.
Visual instruction tuning is crucial for enhancing the zero-shot generalization capability of Multi-modal Large Language Models (MLLMs). In this paper, we aim to investigate a fundamental question: ''what makes for good visual instructions''. Through a comprehensive empirical study, we find that instructions focusing on complex visual reasoning tasks are particularly effective in improving the performance of MLLMs, with results correlating to instruction complexity. Based on this insight, we develop a systematic approach to automatically create high-quality complex visual reasoning instructions. Our approach employs a synthesize-complicate-reformulate paradigm, leveraging multiple stages to gradually increase the complexity of the instructions while guaranteeing quality. Based on this approach, we create the ComVint dataset with 32K examples, and fine-tune four MLLMs on it. Experimental results consistently demonstrate the enhanced performance of all compared MLLMs, such as a 27.86% and 27.60% improvement for LLaVA on MME-Perception and MME-Cognition, respectively. Our code and data are publicly available at the link: https://github.com/RUCAIBox/ComVint.
연구 동기 및 목표
- 다중모달 LLM의 성능 향상에 효과적인 시각적 지시의 핵심 요인을 특정하기.
- 작업 유형, 지시 복잡도, 애너테이션 다양성 중 어느 것이 MLLM 성능에 가장 큰 영향을 미치는지 조사하기.
- 고품질 복잡한 시각적 추론 지시를 자동으로 체계적으로 생성하는 방법 개발하기.
- 다양한 벤치마크에서 MLLM의 zero-shot 일반화 능력을 향상시키기 위한 대규모 합성 데이터셋 구축하기.
- 지시 복잡도와 형식이 다양한 벤치마크에서 모델 성능에 미치는 영향 평가하기.
제안 방법
- 복잡한 시각적 추론 지시를 생성하기 위해 '합성-복잡화-다시정의' 파이프라인을 사용한다.
- 초기 지시는 이미지 애너테이션(예: 캡션, 객체 등)에 기반한 프롬프트를 사용해 GPT-4로 합성한다.
- 복잡화-검증 루프를 반복적으로 적용하여 지시의 복잡도를 점진적으로 증가시키면서 사실 일관성과 품질을 유지한다.
- 다시정의 모듈은 지시를 다양한 형식(개방형, 부울형 QA, 다중선택형 QA)으로 변환하여 보다 넓은 후행 적응성을 확보한다.
- 이 방법은 두 가지 유형의 추론을 생성한다: 이미지 콘텐츠 기반의 교차모달 추론과 외부 지식이 필요한 외부지식 추론.
- 최종 데이터셋인 ComVint은 32,000개의 예제를 포함하며, MLLM 파인튜닝을 위해 공개된다.
실험 결과
연구 질문
- RQ1시각적 지시 튜닝에서 어떤 작업 유형이 MLLM 성능 향상에 가장 효과적인가?
- RQ2지시 복잡도가 작업 다양성과 애너테이션 세분성에 비해 모델 능력 향상에 얼마나 더 큰 기여를 하는가?
- RQ3허구 없이 고품질 복잡한 시각적 추론 지시를 자동 파이프라인으로 생성할 수 있는가?
- RQ4지시 형식(예: 개방형 vs. 다중선택형)이 다양한 벤치마크에서 모델 성능에 어떤 영향을 미치는가?
- RQ5MLLM 일반화 능력을 극대화하기 위해 최적의 시각적 추론 지시 복잡도 수준은 무엇인가?
주요 결과
- 복잡한 시각적 추론 작업은 평가 벤치마크에서 이미지 캡션 작성과 시각적 질의 응답보다 MLLM 성능 향상에 훨씬 더 효과적이다.
- 지시 복잡도를 높이는 것이 작업 다양성 향상이나 세분화된 애너테이션 추가보다 더 큰 성능 향상 기여를 한다.
- ComVint 데이터셋은 32,000개의 합성 복잡한 시각적 추론 지시를 포함하며, MiniGPT-4와 BLIP-2의 MME-Cognition 성능을 각각 32.6%와 28.8% 향상시킨다.
- 복잡화 모듈은 성능 향상에 기여한다: 1라운드 복잡화로 교차모달 추론 성능이 평균 약 1점 향상되었고, 2라운드 복잡화로 외부지식 추론 성능이 1점 이상 향상되었다.
- 지시 형식은 중요하다: bool QA 형식은 SEED-Bench에서 가장 높은 정확도를 기록했고, 다중선택형 QA 형식은 MME-Perception에서 가장 뛰어난 성능을 보였다.
- 개방형, bool QA, 다중선택형 지시 형식을 모두 조합하면 모든 벤치마크에서 평균 정확도가 가장 높았으며, 형식 다양성의 이점이 입증되었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.