[논문 리뷰] VIGC: Visual Instruction Generation and Correction
이 논문은 다중모달 대규모 언어 모델이 자율적으로 고품질의 시각-언어 지시 데이터를 생성하고 반복적으로 보정할 수 있도록 하는 VIGC 프레임워크를 제안한다. 이는 환각 현상을 크게 감소시킨다. 시각적 지시 생성(VIG)을 통해 다양한 데이터를 생성하고, 반복적인 Q-Former 업데이트 전략을 사용한 시각적 지시 보정(VIC)을 결합함으로써 VIGC는 최종 모델 성능을 향상시키며, OKVQA 및 A-OKVQA에서 각각 1.6% 향상된 최신 기술 수준의 성능을 달성한다.
The integration of visual encoders and large language models (LLMs) has driven recent progress in multimodal large language models (MLLMs). However, the scarcity of high-quality instruction-tuning data for vision-language tasks remains a challenge. The current leading paradigm, such as LLaVA, relies on language-only GPT-4 to generate data, which requires pre-annotated image captions and detection bounding boxes, suffering from understanding image details. A practical solution to this problem would be to utilize the available multimodal large language models (MLLMs) to generate instruction data for vision-language tasks. However, it's worth noting that the currently accessible MLLMs are not as powerful as their LLM counterparts, as they tend to produce inadequate responses and generate false information. As a solution for addressing the current issue, this paper proposes the Visual Instruction Generation and Correction (VIGC) framework that enables multimodal large language models to generate instruction-tuning data and progressively enhance its quality on-the-fly. Specifically, Visual Instruction Generation (VIG) guides the vision-language model to generate diverse instruction-tuning data. To ensure generation quality, Visual Instruction Correction (VIC) adopts an iterative update mechanism to correct any inaccuracies in data produced by VIG, effectively reducing the risk of hallucination. Leveraging the diverse, high-quality data generated by VIGC, we finetune mainstream models and validate data quality based on various evaluations. Experimental results demonstrate that VIGC not only compensates for the shortcomings of language-only data generation methods, but also effectively enhances the benchmark performance. The models, datasets, and code are available at https://opendatalab.github.io/VIGC.
연구 동기 및 목표
- 언어 전용 모델인 GPT-4에 의존할 경우에 특히 부족한 고품질의 시각-언어 지시 튜닝 데이터 문제를 해결하기 위해.
- 비용이 많이 들고 시각적 세부 정보를 상실하는 기존 데이터 생성 방법의 한계를 극복하기 위해.
- 다중모달 모델이 환각 현상 감소를 바탕으로 자율적으로 자신의 지시 데이터를 생성하고 개선할 수 있는 자기지도 학습 프레임워크를 개발하기 위해.
- 다양한 벤치마크와 모델 크기에서의 종합적 평가를 통해 VIGC가 생성한 데이터의 효과성을 검증하기 위해.
제안 방법
- VIGC는 두 단계 프레임워크를 사용한다: 시각-언어 모델을 활용해 다양한 이미지-질문-답변 삼중항을 생성하는 시각적 지시 생성(VIG).
- 반복적인 Q-Former(IQF) 업데이트 메커니즘을 사용하는 시각적 지시 보정(VIC) 모듈은 VIG에서 유도된 환각되거나 부정확한 응답을 보정한다.
- VIC 모듈은 모델의 자기 일관성과 지식 기반 접근을 활용해 반복적인 보정을 통해 답변 정밀도를 향상시킨다.
- 이 프레임워크는 COCO 및 Objects365 데이터셋에서 훈련되어 36,781개의 VIGC-LLaVA-COCO 및 약 180만 개의 VIGC-LLaVA-Objects365 샘플을 생성한다.
- 생성된 데이터는 LLaVA 및 InstructBLIP 등의 모델을 미세조정하는 데 사용되며, MMBench, LLaVA, OKVQA 및 A-OKVQA에서 성능을 평가한다.
- 자기 생성 데이터가 모델 성능을 향상시키고, 그 결과 향후 데이터 품질이 향상되는 폐쇄형 루프 학습 전략을 탐색한다.
실험 결과
연구 질문
- RQ1다중모달 대규모 언어 모델은 언어 전용 모델에 의존하지 않고 다양한 고품질의 시각-언어 지시 데이터를 생성할 수 있는가?
- RQ2반복적 보정 메커니즘은 자가 생성된 다중모달 지시 데이터의 환각 현상을 효과적으로 줄일 수 있는가?
- RQ3VIGC가 생성한 데이터는 전통적인 지시 튜닝 데이터보다 최종 모델 성능 향상에 더 효과적인가?
- RQ4VIGC가 생성한 데이터는 외부 지식이 필요한 제로샷 및 희소샷 벤치마크에서 모델 성능 향상에 기여하는가?
- RQ5데이터 생성과 모델 미세조정의 자가 향상 루프는 다수 반복 주기 동안 지속적인 성능 향상을 이끌 수 있는가?
주요 결과
- LLaVA 및 VIGC가 생성한 데이터를 사용해 미세조정한 모델은 MMBench, LLaVA, OKVQA에서 각각 84.0%, 85.8%, 83.3%의 성능을 기록하여 강력한 일반화 능력을 입증했다.
- VIC 보정 데이터 추가로 A-OKVQA에서 1.6% 향상되고 OKVQA에서 0.7% 향상되어 이 크기의 모델에서 최신 기술 수준의 성능을 달성했다.
- LLaVA와 VIGC가 생성한 데이터의 혼합물에 대해 미세조정한 모델은 데이터 볼륨을 동일하게 유지하더라도 LLaVA 전용 데이터로만 훈련한 모델보다 성능이 뛰어났다.
- LLaVA-13B와 같은 다양한 모델 크기에서 성능 향상이 관찰되어 VIGC 접근법의 확장성이 확인되었다.
- VIGC가 생성한 데이터를 사용한 자기 반복 학습은 MMBench 및 LLaVA에서 모두 모델 성능 향상에 기여하여 폐쇄형 자기 향상 잠재력이 있음을 시사했다.
- VIC 모듈은 원시 VIG 데이터 대비 미미한 성능 향상에 비해 VIC로 보정된 데이터에서는 상당한 성능 향상이 관찰되어 환각 현상을 크게 감소시켰음을 입증했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.