[논문 리뷰] Pink: Unveiling the Power of Referential Comprehension for Multi-modal LLMs
이 논문은 기존 애너테이션을 자가일관성 있는 부트스트래핑 방식으로 활용해 저비용으로 고품질의 지시 튜닝 데이터를 구성함으로써 다중모달 LLM의 세밀한 이미지 이해 능력을 향상시키는 Pink이라는 프레임워크를 소개한다. 세밀한 객체 애너테이션을 참조 표현-바운딩 박스 쌍으로 확장하고, 어댑터/LoRA를 사용해 시각 인코더를 지시 튜닝함으로써 Pink은 공개 데이터만을 사용하여 GQA (+5.2%), RefCOCO_val (+Kosmos-2 대비 +24.7%), MMBench 랜딩리스트에서 최신 기술 수준(SOTA) 성능을 달성한다.
Multi-modal Large Language Models (MLLMs) have shown remarkable capabilities in various multi-modal tasks. Nevertheless, their performance in fine-grained image understanding tasks is still limited. To address this issue, this paper proposes a new framework to enhance the fine-grained image understanding abilities of MLLMs. Specifically, we present a new method for constructing the instruction tuning dataset at a low cost by leveraging annotations in existing datasets. A self-consistent bootstrapping method is also introduced to extend existing dense object annotations into high-quality referring-expression-bounding-box pairs. These methods enable the generation of high-quality instruction data which includes a wide range of fundamental abilities essential for fine-grained image perception. Moreover, we argue that the visual encoder should be tuned during instruction tuning to mitigate the gap between full image perception and fine-grained image perception. Experimental results demonstrate the superior performance of our method. For instance, our model exhibits a 5.2% accuracy improvement over Qwen-VL on GQA and surpasses the accuracy of Kosmos-2 by 24.7% on RefCOCO_val. We have also attained the top rank on the leaderboard of MMBench. This promising performance is achieved by training on only publicly available data, making it easily reproducible. The models, datasets, and codes are publicly available at https://github.com/SY-Xuan/Pink.
연구 동기 및 목표
- 거시적 수준의 시각 작업에서 강력한 성능을 보이지만 여전히 세밀한 이미지 이해 능력이 제한된 다중모달 LLM의 세밀한 이미지 이해 능력을 향상시키기 위해.
- 다중모달 학습에서 참조 이해(RefCOCO) 작업을 위한 다양한 고품질 지시 데이터의 부족 문제를 해결하기 위해.
- 전체 이미지 인식과 세밀한 인식 간 성능 격차를 줄이기 위해 지시 튜닝 중 시각 인코더의 적응 가능성 향상하기 위해.
- 비용이 많이 들지 않는, 재현 가능한 방법으로 존재하는 애너테이션을 활용해 고품질의 참조 이해 지시 데이터를 생성하기 위해.
- 특허 또는 대규모 데이터에 의존하지 않고 표준 벤치마크에서 최신 기술 수준 성능을 달성하기 위해.
제안 방법
- Visual 그라운드와 같은 데이터셋의 기존 애너테이션을 활용해 다양한 참조 이해 작업(예: 시각적 관계, 공간적 추론 포함)을 구성한다.
- 기존의 고밀도 객체 애너테이션에서 고품질의 참조 표현-바운딩 박스 쌍을 자가일관성 있는 부트스트래핑 방식으로 자동 생성함으로써 고비용 LLM 기반 애너테이션을 피한다.
- 다양한 참조 이해 작업(예: 로컬라이제이션, 다중 선택 VQA)을 커버하는 지시 템플릿을 설계하고 통합된 지시 튜닝 데이터셋에 통합한다.
- 전체 시각적 인식과 세밀한 인식 간 격차를 줄이기 위해 파rameter 효율적인 방법(예: LoRA, 어댑터)을 사용해 시각 인코더를 튜닝한다.
- 이중 단계 트레이닝 파이프라인을 사용: 공개 데이터에서의 사전 학습 → 새로 구성된 참조 중심 지시 튜닝 데이터를 활용한 지시 튜닝.
- 일관되고 확장 가능한 데이터 파이프라인을 활용해 세밀한 인식을 위한 고품질, 다양한, 일반화 가능한 지시 예제를 보장한다.

실험 결과
연구 질문
- RQ1기존의 공개 데이터만을 사용해 다중모달 LLM의 세밀한 이미지 이해 능력을 크게 향상시킬 수 있는가?
- RQ2LLM 기반 데이터 생성에 의존하지 않고 자가일관성 있는 부트스트래핑 방법이 고품질의 참조 표현-바운딩 박스 쌍을 생성할 수 있는가?
- RQ3지시 튜닝 중 시각 인코더를 튜닝하면 세밀한 인식 작업에서 측정 가능한 성능 향상이 이루어지는가?
- RQ4저비용, 데이터 효율적인 지시 튜닝 전략이 GQA 및 MMBench와 같은 표준 벤치마크에서 최신 기술 수준 성능을 달성할 수 있는가?
- RQ5지시 튜닝에 기본 능력(예: 인스턴스 식별, 공간적 추론)을 통합하면 참조 이해 작업 전반에 걸친 모델 일반화 능력에 어떤 영향을 미치는가?
주요 결과
- Pink은 GQA 벤치마크에서 Qwen-VL 대비 5.2%의 정확도 향상을 기록하여 세밀한 추론 능력에서 뛰어난 성능을 입증한다.
- RefCOCO_val에서 Kosmos-2를 24.7% 초월하여 로컬라이제이션 및 참조 이해 능력이 뛰어나다는 것을 입증한다.
- MMBench 랜딩리스트에서 최상위 순위를 기록하여 다양한 다중모달 이해 작업에 걸쳐 뛰어난 견고성을 입증한다.
- 단지 670만 개의 트레이너블 파라미터로 OK-VQA에서 Shikra 대비 최대 6.0%의 정확도 향상을 기록하여 높은 효율성과 효과성을 보여준다.
- 특허나 대규모 데이터에 의존하지 않고 공개 데이터만을 사용해 SOTA 성능을 달성하여 연구 공동체가 완전히 재현 가능하고 접근 가능한 방법을 제공한다.
- 자기일관성 있는 부트스트래핑 방법이 기존 애너테이션에서 고품질의 RC 데이터를 성공적으로 생성하여 고비용 LLM 기반 데이터 생성에 대한 의존도를 감소시켰다.
![Figure 2 : The illustration of our Pink model. Pink follows the architecture of LLaVA [ 22 ] , which consists of three main components: a visual encoder, a projection layer, and a decoder-only LLM. The coordinates of a bounding box are converted into texts in a specific format. During instruction tu](https://ar5iv.labs.arxiv.org/html/2310.00582/assets/x2.png)
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.