[논문 리뷰] Lyrics: Boosting Fine-grained Language-Vision Alignment and Comprehension via Semantic-aware Visual Objects
Lyrics는 이미지 태깅, 물체 검출 및 의미 세분화를 통합한 시각 리퍼너를 활용해 의미 인식 시각 객체를 통합함으로써 세분화된 언어-시각 정렬을 향상시키는 이단계적 시각-언어 사전학습 및 지시 피지테이닝 프레임워크를 제안한다. 국소적 및 전역적 시각 특징에서 유도된 다중 척도 쿼리를 활용함으로써 Lyrics는 13개의 시각-언어 벤치마크에서 최고 수준 또는 경쟁력 있는 성능을 달성하며, 세밀한 이미지 이해 및 대화 작업에서 시각 환각과 사실 오류를 크게 감소시킨다.
Large Vision Language Models (LVLMs) have demonstrated impressive zero-shot capabilities in various vision-language dialogue scenarios. However, the absence of fine-grained visual object detection hinders the model from understanding the details of images, leading to irreparable visual hallucinations and factual errors. In this paper, we propose Lyrics, a novel multi-modal pre-training and instruction fine-tuning paradigm that bootstraps vision-language alignment from fine-grained cross-modal collaboration. Building on the foundation of BLIP-2, Lyrics infuses local visual features extracted from a visual refiner that includes image tagging, object detection and semantic segmentation modules into the Querying Transformer, while on the text side, the language inputs equip the boundary boxes and tags derived from the visual refiner. We further introduce a two-stage training scheme, in which the pre-training stage bridges the modality gap through explicit and comprehensive vision-language alignment targets. During the instruction fine-tuning stage, we introduce semantic-aware visual feature extraction, a crucial method that enables the model to extract informative features from concrete visual objects. Our approach achieves robust performance on 13 datasets across various vision-language tasks, and demonstrates promising multi-modal understanding, perception and conversation capabilities in 11 scenario-based benchmark toolkits.
연구 동기 및 목표
- 표준 이미지 인코더에서 유도되는 국소적 시각 특징의 부족으로 인해 대규모 시각-언어 모델(LVLMs)이 세밀한 시각적 세부 정보를 포착하지 못하는 데 기인한 한계를 해결하기 위해.
- 텍스트 지시어와 정밀한 시각 객체 표현 간의 정렬을 향상시켜 시각-언어 작업에서 시각 환각과 사실 오류를 줄이기 위해.
- 명시적이고 다중 척도의 시각 기반을 통해 실세계 대화 시나리오에서의 다중 모달 이해 및 생성 능력을 향상시키기 위해.
- 지시어 수행 및 추론을 위한 지능형 LVLM을 개발하기 위해 의미 인식 시각 특징을 대규모 언어 모델에 효과적으로 통합하기 위해.
제안 방법
- 이미지 태깅, 물체 검출 및 의미 세분화 모듈을 포함한 시각 리퍼너를 도입하여 국소적 시각 특징과 공간 표현을 추출한다.
- 전역 이미지 인코더 특징과 리퍼너에서 유도된 국소적 시각 특징을 압축하고 정렬하기 위해 다중 척도 쿼리 트랜스포머(MQ-Former)를 활용한다.
- 이중 단계 학습 프레임워크를 적용한다: 첫 번째 단계로 다중 작업 사전학습을 통해 시각-언어 정렬 작업을 통해 모odal 갭을 메운다; 두 번째 단계로 LLM에 대해 LoRA 적응을 통한 지시 피지테이닝을 수행한다.
- 시각 리퍼너에서 유도된 경계 상자와 태그를 구조화된 입력으로 활용하여 MQ-Former의 주의 메커니즘을 안내하고 기반 정확도를 향상시킨다.
- 학습 가능한 쿼리 벡터를 활용해 시각 표현을 LLM으로 압축하여 종단 간 지시어 수행 생성을 가능하게 한다.
- 지시 피지테이닝 동안 저차원 적응(LoRA)을 적용하여 LLM을 효율적으로 피지테이닝하면서 사전학습 지식을 유지한다.
실험 결과
연구 질문
- RQ1세분화된 시각 객체 특징을 통합하면 LVLM에서 시각-언어 정렬이 향상되고 시각 환각이 감소하는가?
- RQ2다중 모듈 시각 리퍼너에서 유도된 의미 인식 시각 특징의 사용이 다양한 시각-언어 작업에서 zero-shot 및 few-shot 성능에 어떤 영향을 미치는가?
- RQ3이중 단계 학습 프레임워크(정렬을 위한 사전학습 및 지시어 수행을 위한 피지테이닝)는 세밀한 이미지 이해 및 추론 능력을 어느 정도 향상시키는가?
- RQ4전역 및 국소적 시각 신호를 모두 사용할 때 MQ-Former 아키텍처가 이미지 인코더와 LLM 간의 모달 갭을 효과적으로 해소하는가?
주요 결과
- Lyrics는 이미지 캡션, 시각적 질의 응답, 언어로 지목된 표현 이해를 포함한 13개의 시험된 시각-언어 벤치마크에서 최고 수준 또는 경쟁력 있는 성능을 달성한다.
- 제거 실험 결과, 공간 표현 또는 사전학습 단계를 제거할 경우 성능 저하가 심각하게 발생하며, 특히 공간 추론이 필요한 작업(예: TextVQA, RefCOCOg)에서 두드러진다.
- 세분화된 시각 신호가 없는 상황에서 BLIP-2 및 InstructBLIP과 같은 이전 모델들은 사실 오류와 환각을 유발하지만, Lyrics는 객체 수, 색상, 운동, 공간 관계를 정확히 식별한다.
- Lyrics는 강력한 few-shot 학습 능력을 보이며, 최소한의 컨텍스트 예시로도 안정적이고 상승하는 성능 추세를 보이며, 더 큰 백본을 가진 모델들을 능가한다.
- 정성적 결과는 Lyrics가 객체 속성과 공간 관계를 포함한 정확하고 기반된 기술을 생성할 수 있음을 확인한다. 예를 들어 특정 옷차리와 얼굴 특징을 가진 네 명의 스키어가 쉬는 자세로 있는 것을 정확히 식별한다.
- 모델는 LLM으로부터 공통 지식 추론 및 코드 실행 이해 능력을 효과적으로 이관하여 상징적 지식과 시각 지식의 통합이 성공적으로 이루어졌음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.