[논문 리뷰] Can Multimodal Large Language Models Truly Perform Multimodal In-Context Learning?
이 논문은 시각-언어 모델(VLMs)에서의 인-컨텍스트 러닝(ICL)을 조사하며, 시범 예제의 텍스트 정보가 성능을 지배하는 것으로 밝혀졌고, 크로스 어텐션 메커니즘의 아키텍처적 한계로 인해 시각적 콘텐츠의 영향은 미미하다고 한다. ICL을 향상시키기 위해 저자들은 시각적 및 언어 모odal 신호를 함께 사용하는 MMICES—다중모态 시범 예제 선택 방법—을 제안하며, 다양한 VLM과 벤치마크에서 성능을 크게 향상시켰다.
Large Language Models (LLMs) with in-context learning (ICL) ability can quickly adapt to a specific context given a few demonstrations (demos). Recently, Multimodal Large Language Models (MLLMs) built upon LLMs have also shown multimodal ICL ability, i.e., responding to queries given a few multimodal demos, including images, queries, and answers. While ICL has been extensively studied on LLMs, its research on MLLMs remains limited. One essential question is whether these MLLMs can truly conduct multimodal ICL, or if only the textual modality is necessary. We investigate this question by examining two primary factors that influence ICL: 1) Demo content, i.e., understanding the influences of demo content in different modalities. 2) Demo selection strategy, i.e., how to select better multimodal demos for improved performance. Experiments revealed that multimodal ICL is predominantly driven by the textual content whereas the visual information in the demos has little influence. Interestingly, visual content is still necessary and useful for selecting demos to increase performance. Motivated by our analysis, we propose a simple yet effective approach, termed Mixed Modality In-Context Example Selection (MMICES), which considers both visual and language modalities when selecting demos. Extensive experiments are conducted to support our findings and verify the improvement brought by our method. Code is available at \url{https://chenxshuo.github.io/m-icl/}.
연구 동기 및 목표
- 시각-언어 모델(VLMs)의 다중모달 인-컨텍스트 러닝(ICL) 시범 예제에서 시각적 및 텍스트 정보의 기여도를 조사하기 위해.
- 시범 예제의 시각적 정보가 VLM의 ICL 성능에 제한적인 영향을 미치는 이유를 이해하기 위해.
- 더 효과적인 시범 예제 선택 전략을 개발하여, 성능 향상을 위해 시각적 및 언어 모달리티를 함께 활용하기 위해.
- 제안된 방법을 다양한 VLM과 시각-언어 벤치마크에서 검증하기 위해.
제안 방법
- 시각적 유사도로 후보를 사전에 걸러내고, 이후 언어 모달리티를 사용해 순위를 매기는 이중 단계의 시범 예제 선택 방법인 혼합 모달리티 인-컨텍스트 예제 선택(MMICES)을 제안한다.
- 언어 기반 순위 매기기 이전에 시각 임베딩 유사도를 사용해 잠재적 시범 예제 후보를 사전에 걸러낸다.
- 질의와 시범 예제 간의 관련도 점수를 텍스트 콘텐츠 기반으로 대비 언어 모델링을 적용해 계산한다.
- 시각적 및 텍스트 신호를 통합된 선택 파이프라인에 통합하여, 질의에 대해 의미적으로도, 시각적으로도 관련성이 높은 시범 예제를 선택한다.
- OpenFlamingo 및 IDEFICS와 같은 다양한 VLM에서 시각질의 질문 응답(VQA), GQA, COCO 캡션 생성과 같은 여러 시각-언어 작업에서 방법을 평가한다.
- 소수의 예제(4-shot 및 8-shot 설정)에서 랜덤 선택 및 언어 전용 기반인 RICES와의 비교를 수행한다.

실험 결과
연구 질문
- RQ1시각-언어 모델에서 인-컨텍스트 러닝 성능을 결정하는 데 있어, 시각적 모달리티와 텍스트 모달리티 중 어느 것이 더 중요한 역할을 하는가?
- RQ2입력에 포함되어 있음에도 불구하고, 시범 예제의 시각적 정보가 ICL 성능에 미미한 영향을 미치는 이유는 무엇인가?
- RQ3시각적 및 언어 모달리티를 함께 고려하는 시범 예제 선택 전략이 VLM의 ICL 성능 향상에 기여할 수 있는가?
- RQ4모델의 내부 어텐션 메커니즘이 이전 시범 예제의 시각적 토큰 영향을 제한하는 방식은 무엇인가?
- RQ5제안된 MMICES 방법은 다양한 VLM 아키텍처와 후행 작업에서 일관되게 ICL 성능을 향상시키는가?
주요 결과
- 시범 예제의 텍스트 정보가 VLM의 인-컨텍스트 러닝 성능를 주도하는 핵심 요소이며, 텍스트를 제거하거나 손상시키면 성능 저하가 심각하게 발생한다.
- 시범 예제의 이미지를 공백 이미지로 교체하거나 제거해도 성능 저하가 거의 없어, 시각 콘텐츠가 ICL에 미치는 기여가 미미하다는 것을 시사한다.
- 크로스 어텐션 레이어의 개별 이미지 마스킹 메커니즘이 생성 과정 중 직접적인 시각 토큰 접근을 제한하여, 이전 시범 예제의 이미지가 미치는 영향이 제한된다.
- 모델 내부 상태 분석 결과, 시범 예제의 시각적 특징은 최종 출력에 거의 또는 전혀 영향을 주지 않으며, 반면 텍스트 임베딩은 어텐션과 생성 과정에 강력한 영향을 미친다.
- 모든 평가된 모델과 데이터셋에서 랜덤 선택 및 RICES보다 MMICES가 뛰어난 성능을 보이며, 특히 소수의 예제(4-shot 및 8-shot) 설정에서 두드러진 성능 향상을 보였다.
- OpenFlamingo와 같은 더 작은 모델에서도 일관된 성능 향상을 기록하여, 파rameter 효율성이 중요한 상황에서 특히 효과적임을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.