[논문 리뷰] Many-Shot In-Context Learning in Multimodal Foundation Models
이 논문은 최대 약 2,000개의 다중모态 예시를 사용하여 다중모달 기초 모델에서 다수 샘플 프롬프트 지도 학습(Many-shot ICL)을 조사한다. GPT-4o와 Gemini 1.5 Pro 모두 다수 샘플 ICL에서 상당한 성능 향상을 보이며, 특히 Gemini 1.5 Pro는 뛰어난 데이터 효율성과 로그선형 성능 향상을 보인다. 또한 쿼리 배치 처리를 통해 정확도를 유지하면서도 단일 예측의 지연과 비용을 줄일 수 있다.
Large language models are effective at few-shot in-context learning (ICL). Recent advancements in multimodal foundation models have enabled unprecedentedly long context windows, presenting an opportunity to explore their capability to perform ICL with many more demonstrating examples. In this work, we evaluate the performance of multimodal foundation models scaling from few-shot to many-shot ICL. We benchmark GPT-4o and Gemini 1.5 Pro across 14 datasets spanning multiple domains (natural imagery, medical imagery, remote sensing, and molecular imagery) and tasks (image classification, visual QA, and object localization). We observe that many-shot ICL, including up to almost 2,000 demonstrating examples, leads to substantial improvements compared to few-shot (<100 examples) ICL across all of the datasets. Further, Gemini 1.5 Pro performance continues to improve log-linearly up to the maximum number of tested examples on many datasets. We also find open-weights multimodal foundation models like Llama 3.2-Vision do not benefit from the demonstrating examples, highlighting an important gap between open and closed multimodal foundation models. Given the high inference costs required for many-shot ICL, we also explore the impact of batching multiple queries in a single API call. We show that batching up to 50 queries can lead to performance improvements under zero-shot and many-shot ICL, with substantial gains in the zero-shot setting on multiple datasets, while drastically reducing per-query cost and latency. Finally, while GPT-4o and Gemini 1.5 Pro achieve similar zero-shot performance across the datasets, Gemini 1.5 Pro learns more quickly than GPT-4o on most datasets. Our results suggest that many-shot ICL could enable users to efficiently adapt multimodal foundation models to new applications and domains. Our codebase is publicly available at https://github.com/stanfordmlgroup/ManyICL .
연구 동기 및 목표
- 시작 예시 수를 소수 샘플에서 다수 샘플로 늘일수록 다중모달 기초 모델의 지도 학습 성능이 어떻게 변화하는지 평가하기 위해.
- 다양한 다중모달 데이터셋에서 GPT-4o와 Gemini 1.5 Pro의 데이터 효율성과 성능 스케일링을 비교하기 위해.
- 단일 API 호출에 여러 쿼리를 배치함으로써 추론 비용, 지연, 성능에 미치는 영향을 분석하기 위해.
- 배치 처리된 제로샷 ICL에서 관찰된 성능 향상의 메커니즘을 분석하기 위해, 도메인 校정 및 자가 생성 예시 등을 고려하기 위해.
- 기초 모델을 새로운 작업에 맞게 미세조정 없이 적응시키기 위해 다수 샘플 ICL의 실용적 타당성을 평가하기 위해.
제안 방법
- 자연 영상, 의료 영상, 원격 감시 영상, 분자 영상 등 다양한 분야의 10개 다중모달 데이터셋에서 GPT-4o와 Gemini 1.5 Pro를 평가하며, 다중 클래스, 다중 레이블, 세분화된 분류 작업을 포함한다.
- 프롬프트에 다수의 다중모달 예시를 포함시켜 소수 샘플(<100개 예시)에서 다수 샘플(최대 1,999개 예시)으로 지도 학습을 확장한다.
- 다양한 샘플 수 설정과 쿼리 배치 여부에 따라 성능 향상, 데이터 효율성, 추론 비용/지연을 측정한다.
- API 호출당 최대 50개의 쿼리까지 배치 처리를 통해 단일 예측의 지연과 비용을 줄이고, 성능을 유지하거나 향상시킨다.
- 배치 처리된 제로샷 ICL에서 성능 향상의 원인을 분석하기 위해 추론 실험을 수행하며, 도메인 校정, 클래스 校정, 자동 생성 예시 등이 주요 기여 요소로 확인된다.
- 동일한 하드웨어와 위치에서 실험하여 공정한 비교를 확보하고 데이터 전송 오염 요소를 최소화한다.

실험 결과
연구 질문
- RQ1소수 샘플에서 다수 샘플로 지도 학습의 예시 수를 늘일수록 다양한 데이터셋에서 다중모달 기초 모델의 성능에 어떤 영향을 미치는가?
- RQ2Gemini 1.5 Pro와 GPT-4o는 다수 샘플 ICL 환경에서 데이터 효율성과 성능 스케일링 측면에서 어떻게 비교되는가?
- RQ3단일 API 호출에 여러 쿼리를 배치함으로써 단일 예측의 추론 비용과 지연을 줄일 수 있으며, 성능은 유지 또는 향상되는가?
- RQ4배치 처리된 제로샷 ICL에서 관찰된 성능 향상의 메커니즘은 무엇인가?
- RQ5다수 샘플 ICL는 기초 모델을 새로운 작업과 도메인에 적응시키기 위해 미세조정을 대체할 수 있을 정도로 활용 가능한가?
주요 결과
- Gemini 1.5 Pro는 지도 학습 예시 수가 증가함에 따라 성능 향상이 로그선형적으로 나타나지만, GPT-4o는 더 불안정한 향상을 보인다.
- 평가한 10개 데이터셋 대부분에서 Gemini 1.5 Pro는 GPT-4o보다 더 높은 지도 학습 데이터 효율성을 보였다.
- 다수 샘플 ICL 환경에서 최대 50개의 쿼리까지 배치 처리를 통해 단일 예측 지연을 최대 35배, 비용을 최대 45배까지 줄일 수 있었다.
- 쿼리 배치 처리로 제로샷 설정에서 뚜렷한 성능 향상이 발생했으며, 이는 도메인 校정, 클래스 校정, 자가 생성 예시 등에 기인한다.
- HAM10000 데이터셋에서, 배치 처리로 단일 예측 지연은 17.3초에서 0.54초로 감소했고, 비용은 $0.8420에서 $0.0877로 감소했다(350-shot ICL 기준).
- TerraIncognita 데이터셋에서, 배치 처리로 단일 예측 지연은 34.9초에서 1.7초로 감소했고, 비용은 $1.8420에서 $0.0406로 감소했다(810-shot ICL 기준).

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.