Skip to main content
QUICK REVIEW

[논문 리뷰] Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context

Gemini Robotics Team, Petko Georgiev|arXiv (Cornell University)|2024. 03. 08.
Semantic Web and Ontologies인용 수 276
한 줄 요약

Gemini 1.5는 두 가지 긴 컨텍스트 다중 모달 모델(Gemini 1.5 Pro 및 Gemini 1.5 Flash)을 도입하여 수백만 개의 토큰을 기억하고 추론하며, 긴 컨텍스트 검색을 거의 완벽하게 달성하고 긴 문서 QA, 긴 동영상 QA, 및 긴 컨텍스트 ASR에서 최첨단 성능을 달성합니다.

ABSTRACT

In this report, we introduce the Gemini 1.5 family of models, representing the next generation of highly compute-efficient multimodal models capable of recalling and reasoning over fine-grained information from millions of tokens of context, including multiple long documents and hours of video and audio. The family includes two new models: (1) an updated Gemini 1.5 Pro, which exceeds the February version on the great majority of capabilities and benchmarks; (2) Gemini 1.5 Flash, a more lightweight variant designed for efficiency with minimal regression in quality. Gemini 1.5 models achieve near-perfect recall on long-context retrieval tasks across modalities, improve the state-of-the-art in long-document QA, long-video QA and long-context ASR, and match or surpass Gemini 1.0 Ultra's state-of-the-art performance across a broad set of benchmarks. Studying the limits of Gemini 1.5's long-context ability, we find continued improvement in next-token prediction and near-perfect retrieval (>99%) up to at least 10M tokens, a generational leap over existing models such as Claude 3.0 (200k) and GPT-4 Turbo (128k). Finally, we highlight real-world use cases, such as Gemini 1.5 collaborating with professionals on completing their tasks achieving 26 to 75% time savings across 10 different job categories, as well as surprising new capabilities of large language models at the frontier; when given a grammar manual for Kalamang, a language with fewer than 200 speakers worldwide, the model learns to translate English to Kalamang at a similar level to a person who learned from the same content.

연구 동기 및 목표

  • 극도로 긴 컨텍스트 창(토큰 수 백만 개)으로 다중 모달 이해를 발전시킨다.
  • 품질을 보존하는 계산 효율적 변형을 제공한다(Gemini 1.5 Pro 및 Gemini 1.5 Flash).
  • 긴 컨텍스트 검색, 긴 문서 QA, 긴 동영상 QA, 및 긴 컨텍스트 ASR에서 개선을 입증한다.
  • 저자원 언어 작업에서 실용적인 현실 세계 영향과 놀라운 능력을 보여준다.

제안 방법

  • 두 모델을 개발: 벤치마크 전반에서 February 버전 대비 개선된 Gemini 1.5 Pro와 품질 저하를 최소화한 더 효율적인 Gemini 1.5 Flash를 만든다.
  • 모듈 간 최대 10 million 토큰까지 거의 완벽한 검색(>99%)을 시연한다.
  • 긴 문서 QA, 긴 동영상 QA, 그리고 긴 컨텍스트 ASR 벤치마크에서 Gemini 1.0 Ultra를 포함한 이전 모델과 비교 평가한다.
  • 긴 컨텍스트 길이가 확장될 때 다음 토큰 예측 성능을 분석하여 긴 컨텍스트 한계를 평가한다.
  • 시간 절약 및 교차 도메인 역량을 보여주는 실제 세계 사용 사례를 제시한다.

실험 결과

연구 질문

  • RQ1Gemini 1.5가 텍스트, 비디오, 오디오 전반에서 수백만 개의 토큰을 기억하고 추론하는 능력은 어느 정도인가?
  • RQ2Gemini 1.5 Pro와 Gemini 1.5 Flash 간의 정확도와 효율성 간의 트레이드오프는 무엇인가?
  • RQ3긴 컨텍스트 모델이 긴 문서 QA, 긴 동영상 QA, 그리고 긴 컨텍스트 ASR에서 최첨단 성능을 달성하는가?
  • RQ4다양한 작업(저자원 언어 포함)에서 Gemini 1.5를 배치할 때의 실용적 현실 세계 영향 및 한계는 무엇인가?

주요 결과

  • Gemini 1.5는 최대 10M 토큰까지 거의 완벽한 검색(>99%)을 달성한다.
  • Gemini 1.5 Pro는 2월 버전에 비해 대부분의 기능과 벤치마크에서 우수한 성능을 보인다.
  • Gemini 1.5 Flash는 Pro와 비교할 때 품질 저하를 최소화하면서 효율성을 제공한다.
  • 모델은 긴 문서 QA, 긴 동영상 QA, 그리고 긴 컨텍스트 ASR에서 새로운 최첨단 결과를 달성한다.
  • 실제 시나리오에서 Gemini 1.5는 10개의 직무 범주에서 26–75%의 시간 절약을 가능하게 한다.
  • 모델은 Kalamang를 문법 자료로부터 학습한 학습자와 같은 콘텐츠를 가지고 번역하는 능력 등 놀라운 능력을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.