[논문 리뷰] CrossGET: Cross-Guided Ensemble of Tokens for Accelerating Vision-Language Transformers
CrossGET는 교차모달 가이던스와 완전 그래프 소프트 매칭을 통해 비디오-언어 트랜스포머의 토큰을 적응적으로 감소시켜 가속화하는 보편적 프레임워크입니다. BLIP에서 -5.19%의 정확도 저하를 겪으면서도 최대 2.94배의 FLOP 감소를 달성하며, 다양한 작업과 모델에서 높은 성능을 유지합니다.
Recent vision-language models have achieved tremendous advances. However, their computational costs are also escalating dramatically, making model acceleration exceedingly critical. To pursue more efficient vision-language Transformers, this paper introduces Cross-Guided Ensemble of Tokens (CrossGET), a general acceleration framework for vision-language Transformers. This framework adaptively combines tokens in real-time during inference, significantly reducing computational costs while maintaining high performance. CrossGET features two primary innovations: 1) Cross-Guided Matching and Ensemble. CrossGET leverages cross-modal guided token matching and ensemble to effectively utilize cross-modal information, achieving wider applicability across both modality-independent models, e.g., CLIP, and modality-dependent ones, e.g., BLIP2. 2) Complete-Graph Soft Matching. CrossGET introduces an algorithm for the token-matching mechanism, ensuring reliable matching results while facilitating parallelizability and high efficiency. Extensive experiments have been conducted on various vision-language tasks, such as image-text retrieval, visual reasoning, image captioning, and visual question answering. The performance on both classic multimodal architectures and emerging multimodal LLMs demonstrates the framework's effectiveness and versatility. The code is available at https://github.com/sdc17/CrossGET.
연구 동기 및 목표
- 대규모 비디오-언어 트랜스포머의 증가하는 계산 비용, 특히 자원 제약 조건 하에서의 문제를 해결합니다.
- 다중모달, 교차어텐션 기반 모델에 특화된 효과적인 토큰 감소 기법의 부족을 극복합니다.
- 모odal 독립형(예: CLIP)과 모달 의존형(예: BLIP) 아키텍처 모두에서 효율적인 추론을 가능하게 합니다.
- 최소한의 성능 저하와 거의 없는 파라미터 오버헤드로 높은 가속도를 달성합니다.
- 실시간 배포를 위한 보편적, 학습 가능한, 배포 가능한 프레임워크를 제공합니다.
제안 방법
- 교차가이던스 매칭 및 앙상블 도입: 교차모달 토큰을 경량 에이전트로 사용하여 내모달 토큰 선택과 가중치 앙상블를 안내함으로써 이중 방향의 교차모달 정보 활용을 가능하게 합니다.
- 완전 그래프 소프트 매칭 적용: 양방향 매칭 방법보다 높은 매칭 신뢰도를 확보하면서도 병렬성과 효율성을 유지하기 위해 전체 그래프 매칭 정책을 근사합니다.
- 재학습 없이 추론 시점에 프레임워크를 적용하여 계산 예산에 따라 동적 모델 압축이 가능합니다.
- 비디오 및 언어 브랜치에 최소한의 교차어텐션 파라미터를 통합하여 토큰 선택을 위한 교차모달 중요도 점수를 계산합니다.
- 학습된 중요도 점수를 사용해 매칭된 토큰의 가중치 앙상블를 수행함으로써 모델 표현의 무결성을 유지합니다.
- 제로샷 및 미세조정 모델 적응을 모두 지원하여 재학습 없이도 다양한 감소 비율에서 재평가가 가능합니다.
실험 결과
연구 질문
- RQ1교차모달 가이던스는 비디오-언어 트랜스포머에서 효율적 추론을 위해 부용한 토큰을 효과적으로 식별할 수 있는가?
- RQ2완전 그래프 소프트 매칭 정책은 이분 매칭 대비 매칭 신뢰도를 향상시키면서도 병렬성을 유지하는가?
- RQ3CrossGET는 아키텍처 변경 없이 모달 독립형 및 모달 의존형 비디오-언어 모델에 모두 보편적으로 적용 가능한가?
- RQ4CrossGET는 다양한 비디오-언어 작업에서 성능을 유지하면서 FLOPs를 얼마나 줄일 수 있는가?
- RQ5CrossGET는 재학습 또는 미세조정 없이 추론 시점에 동적 모델 압축을 가능하게 하는가?
주요 결과
- Visual Reasoning 작업(NVLR2 데이터셋)에서 BLIP에 대해 최대 2.94배의 FLOP 감소를 달성했으며, 학습 시 정확도 저하가 5.19%에 그치고, 미세조정 없이도 2.26배의 감소를 기록함.
- Image-Text Retrieval 작업에서 CLIP에 대해 미세조정 없이도 1.04배의 추론 속도 향상(12.56 GFLOPs)을 달성하며 Recall@1이 86.20% 유지되어 원본 모델 대비 효율성이 뛰어남.
- 단일 학습 모델을 다양한 압축 비율에서 재평가할 수 있도록 지원하여, 다양한 추론 예산에서 1.04배에서 2.94배의 속도 향상을 달성함.
- 모든 작업에서 FLOPs를 1.71배에서 2.94배까지 감소시키며, 유사 압축 수준의 기준 모델 대비 정확도를 유지하거나 약간 향상함.
- 완전 그래프 소프트 매칭 정책은 매칭 신뢰도를 향상시켜 이분 매칭 대비 더 일관된 성능 향상을 이끌어냄.
- CrossGET는 거의 없는 파라미터 오버헤드(예: 0.1% 미만 추가 파라미터)를 유도하여 자원 제약이 있는 장치에서 매우 효율적이고 배포 가능함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.