[논문 리뷰] Generalizable Entity Grounding via Assistance of Large Language Model
이 논문은 장문의 캡션에서 의미적 명사를 추출하기 위해 대규모 언어 모델(LMM)을 활용하고, 클래스에 관계없이 분할 모델을 사용하여 개체 마스크를 생성하는 일반화 가능한 엔티티 거시 프레임워크인 GELLA를 제안한다. 색상맵 인코딩 전략과 ResoBlend 모듈을 도입하여 저해상도 CLIP 특징과 고해상도 마스크 특징을 융합함으로써 계산 비용을 크게 줄이고 효율적이고도 민감하며 정확한 팬옵틱 내러티브 거시를 가능하게 하였다. 이는 여러 벤치마크에서 최신 기술(SOTA)을 능가한다.
In this work, we propose a novel approach to densely ground visual entities from a long caption. We leverage a large multimodal model (LMM) to extract semantic nouns, a class-agnostic segmentation model to generate entity-level segmentation, and the proposed multi-modal feature fusion module to associate each semantic noun with its corresponding segmentation mask. Additionally, we introduce a strategy of encoding entity segmentation masks into a colormap, enabling the preservation of fine-grained predictions from features of high-resolution masks. This approach allows us to extract visual features from low-resolution images using the CLIP vision encoder in the LMM, which is more computationally efficient than existing approaches that use an additional encoder for high-resolution images. Our comprehensive experiments demonstrate the superiority of our method, outperforming state-of-the-art techniques on three tasks, including panoptic narrative grounding, referring expression segmentation, and panoptic segmentation.
연구 동기 및 목표
- 기존 엔티티 거시 방법의 유연성 부족, 계산 비용 과다, 특정 분할 파ip라인에 밀접하게 결합된 문제를 해결하기 위해.
- 캡션 생성과 분할 컴포넌트를 분리하여 장문의 캡션으로부터 민감하고 일반화 가능한 엔티티 거시를 가능하게 하기 위해.
- 고해상도 이미지 인코더를 경량 색상맵 인코더로 대체하여 계산 비용을 줄이고 세밀한 마스크 특징을 유지하기 위해.
- ResoBlend 모듈과 CLIP 기반 임베딩을 사용하여 언어와 시각 모odal 간의 특징 일치를 향상시키기 위해.
- 아키텍처 제약 없이 최신 분할 모델과 LLM을 통합할 수 있는 프레임워크를 설계하기 위해.
제안 방법
- 장문의 캡션을 생성하고, 이를 통해 의미적 명사를 추출하기 위해 대규모 다중모odal 모델(LMM)을 활용한다.
- 엔티티 수준의 분할 마스크를 생성하기 위해 클래스에 관계없는 분할 모델(예: EntitySeg)을 사용한다.
- 고해상도 세부 정보를 유지하면서 저비용 처리를 가능하게 하기 위해 고유한 랜덤 색상으로 마스크를 색상맵으로 인코딩한다.
- 경량 구조를 가진 색상맵 인코더를 활용하여 색상맵에서 시각적 특징을 추출함으로써 고해상도 이미지 인코더가 필요 없도록 한다.
- CLIP 시각 인코더(저해상도 이미지 기반)의 특징과 색상맵 인코더(고해상도 마스크 기반)의 특징을 융합하기 위해 ResoBlend 모듈을 도입한다. 이는 특징 일관성을 향상시킨다.
- 학습된 연관 모듈을 사용하여 $<$ SEG $>$ 토큰 임베딩과 엔티티 마스크 특징을 모두 CLIP 이미지 공간에서 유래한 특징으로 정렬함으로써 교차 모달 일치를 보장한다.
실험 결과
연구 질문
- RQ1고해상도 이미지 인코더가 필요 없이 장문의 캡션에서 일반화 가능한 엔티티 거시를 달성할 수 있는가?
- RQ2색상맵 기반 마스크 인코딩 전략은 계산 비용을 줄이면서도 세밀한 분할 세부 정보를 얼마나 잘 유지하는가?
- RQ3ResoBlend 모듈은 저해상도 이미지 특징과 고해상도 마스크 특징 간의 특징 융합을 얼마나 향상시키는가?
- RQ4다양한 사전 학습된 LLM과 분할 모델을 통합할 수 있도록 유연성을 유지하면서도 높은 성능을 유지할 수 있는가?
- RQ5다양한 엔티티 거시 작업에서 정확도와 추론 효율성 측면에서 최신 기술(SOTA)과 비교해 볼 때 본 방법은 어떠한가?
주요 결과
- GELLA는 팬옵틱 내러티브 거시(69.8 AR), 언어 표현 분할, 팬옵틱 분할의 세 벤치마크에서 최신 기술(SOTA)을 능가한다.
- 색상맵 인코딩 전략은 LISA 대비 85% 이상의 계산 비용 절감과 함께 고해상도 마스크 특징을 유지할 수 있었으며, 추론 시간은 5.5초에서 1.2초로 감소하였다.
- 제거 실험 결과, 연관 모듈에 추가적인 완전 연결층을 추가해도 성능 향상이 없었으며, 이는 CLIP 임베딩 특징이 이미 동일한 공간에 잘 정렬되어 있음을 확인한다.
- GELLA는 Swin-Large 백본을 사용한 Mask2Former를 활용하여 COCO 팬옵틱 내러티브 거시 벤치마크에서 69.8 AR을 달성했으며, LISA(43.6 AR) 및 기타 SOTA 방법을 능가한다.
- 프레임워크는 다양한 분할 모델과의 높은 호환성을 보였으며, EntitySeg를 사용할 경우 69.2 AR, Mask2Former를 사용할 경우 69.8 AR을 기록하여 일반화 능력을 입증하였다.
- 낮은 해상도 이미지 특징을 사용함에도 불구하고 높은 성능을 유지함으로써, 정확한 거시에 있어 고해상도 이미지 인코딩이 반드시 필요하지 않음을 입증하였다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.