[논문 리뷰] Beyond Text-Visual Attention: Exploiting Visual Cues for Effective Token Pruning in VLMs
이 논문은 [CLS] 토큰의 어텐션을 활용하여 LLM 내에서 정확도가 떨어지는 텍스트-비주얼 간 상호작용 어텐션에 의존하지 않고, 훈련 없이 시각적 토큰을 정리하는 FasterVLM을 제안한다. 이는 초기 단계에서 중요도가 낮은 시각적 토큰을 제거하여 VLM 추론 효율성을 향상시킨다. FasterVLM는 LLaVA-1.5-7B의 성능의 90%를 유지하면서도 토큰을 95%까지 줄여, 높은 감소 비율에서 기존 방법들보다 뚜렷이 뛰어난 성능을 달성한다.
Large vision-language models (LVLMs) generally contain significantly more visual tokens than their textual counterparts, resulting in a considerable computational burden. Recent efforts have been made to tackle this issue by pruning visual tokens early within the language model. Most existing works use attention scores between text and visual tokens to assess the importance of visual tokens. However, in this study, we first analyze the text-visual attention in the language model and find that this score is not an ideal indicator for token pruning. Based on the analysis, We propose VisPruner, a plug-and-play method that utilizes visual cues for more effective token pruning in LVLMs. Specifically, we first use visual attention to select a limited number of significant tokens. Then, we remove duplicate tokens from the remaining ones based on their similarity. By retaining diverse tokens alongside the initially selected important tokens, we maximally preserve the visual information of the input image. Experimental results demonstrate that our VisPruner sustains strong performance across various VLM architectures and reduction ratios, significantly outperforming existing methods based on text-visual attention. Notably, without any training, VisPruner can reduce the FLOPs of LLaVA-1.5-7B by 91% and inference latency by 75%, while maintaining comparable performance. Our code is available at https://github.com/Theia-4869/VisPruner.
연구 동기 및 목표
- 기존 VLM의 과도한 시각적 토큰으로 인해 추론 과정에서 계산 비용이 증가하는 문제를 해결하기 위해.
- 특히 높은 감소 비율에서 성능 저하가 발생하는 기존 텍스트-비주얼 어텐션 기반 정리 방법의 근본 원인을 규명하기 위해.
- 비주얼 인코더의 [CLS] 토큰 어텐션을 활용하여 더 정확하고 훈련 없이도 가능한 시각적 토큰 정리 방법을 개발하기 위해.
- LLM에 들어가기 전에 토큰을 정리하여 FlashAttention와의 호환성을 확보하고, 추론 속도를 극대화하기 위해.
- LLaVA-1.5, LLaVA-NeXT, Video-LLaVA를 포함한 다양한 VLM 아키텍처에 걸쳐 일반화 능력을 입증하기 위해.
제안 방법
- FasterVLM는 비주얼 인코더 내에서 [CLS] 토큰과 이미지 토큰 간의 어텐션 가중치를 사용하여 시각적 토큰의 중요도를 평가한다. 이는 LLM 내 텍스트-비주얼 어텐션보다 더 정확하다.
- LLM에 의해 처리되기 이전에 [CLS] 어텐션 점수를 가장 낮게 기록한 시각적 토큰을 정리함으로써, 파ip라인의 초기 단계에서 불필요한 계산을 제거한다.
- 이 방법은 훈련 없이도 작동하며, 전적으로 비주얼 인코더 내에서 수행되어 FlashAttention과 같은 최적화된 어텐션 메커니즘과 호환된다.
- LLM 기반의 텍스트-비주얼 어텐션에서 발생하는 어텐션 이동 및 산산이 흩어지는 문제를 피함으로써, 토큰 중요도가 실제 작업의 관련성과 일치하지 않는 문제를 해결한다.
- 전역 어텐션 메커니즘을 통해 비주얼 인코더 내에서 중요도 점수를 더 집중적이고 신뢰할 수 있게 제공한다.
- 이 방법은 LLaVA-1.5, LLaVA-NeXT, Video-LLaVA 등 여러 VLM 아키텍처에 적용되어 광범위한 적용 가능성을 입증한다.
실험 결과
연구 질문
- RQ1기존 텍스트-비주얼 어텐션 기반 정리 방법이 높은 토큰 감소 비율에서 왜 성능 저하가 심각하게 발생하는가?
- RQ2비주얼 인코더의 [CLS] 토큰 어텐션은 LLM 기반의 상호작용 어텐션보다 더 정확하고 안정적인 시각적 토큰 중요도 지표가 될 수 있는가?
- RQ3[CLS] 어텐션 기반으로 시각적 토큰을 정리하면 VLM 추론에서 성능과 효율성의 균형을 더 잘 달성할 수 있는가?
- RQ4이 방법은 재학습 없이도 다양한 VLM 아키텍처에 일반적으로 적용될 수 있는가?
- RQ5FlashAttention와 통합했을 때, 제안된 방법은 효율성과 정확도 측면에서 어떻게 비교되는가?
주요 결과
- FasterVLM는 LLaVA-1.5-7B의 성능의 90%를 유지하면서도 시각적 토큰을 95%까지 줄여, 높은 감소 비율에서 기존 방법들보다 뚜렷이 뛰어난 성능을 기록한다.
- 10개의 벤치마크에서 FasterVLM는 9개의 작업에서 다른 방법들을 앞서며, 나머지 한 작업에서는 동률을 기록한다. 이는 90% 감소 비율에서의 결과이다.
- 95%의 토큰 감소 비율에서 LLaVA-1.5-7B의 평균 정확도는 89.28%를 유지하지만, FastV는 FlashAttention를 사용할 경우 단지 67.22%에 그친다.
- 기본 방법 대비 FLOPs는 최대 88% 감소하고, 추론 시간은 최대 77% 감소하며, 메모리 오버헤드는 최소한이다.
- 제거 실험을 통해 [CLS] 어텐션은 LLM 기반의 텍스트-비주얼 어텐션보다 더 집중적이고 어텐션 이동의 영향을 덜 받는다는 것이 확인되었다.
- LLM 내에서 정리를 수행하는 방법보다 LLM에 들어가기 전에 정리를 수행함으로써, FasterVLM는 FlashAttention와의 호환성을 확보하여 더 빠른 추론을 가능하게 한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.