Skip to main content
QUICK REVIEW

[논문 리뷰] Language Is Not All You Need: Aligning Perception with Language Models

Shaohan Huang, Dong Li|arXiv (Cornell University)|2023. 02. 27.
Multimodal Machine Learning Applications인용 수 164
한 줄 요약

Kosmos-1은 웹 규모의 텍스트, 이미지 및 교차 다중 모달 데이터를 처음부터 학습한 멀티모달 대형 언어 모델로, 파인튜닝 없이 언어, 지각, 비전에 걸친 제로샷 및 소수샷 추론을 수행합니다.

ABSTRACT

A big convergence of language, multimodal perception, action, and world modeling is a key step toward artificial general intelligence. In this work, we introduce Kosmos-1, a Multimodal Large Language Model (MLLM) that can perceive general modalities, learn in context (i.e., few-shot), and follow instructions (i.e., zero-shot). Specifically, we train Kosmos-1 from scratch on web-scale multimodal corpora, including arbitrarily interleaved text and images, image-caption pairs, and text data. We evaluate various settings, including zero-shot, few-shot, and multimodal chain-of-thought prompting, on a wide range of tasks without any gradient updates or finetuning. Experimental results show that Kosmos-1 achieves impressive performance on (i) language understanding, generation, and even OCR-free NLP (directly fed with document images), (ii) perception-language tasks, including multimodal dialogue, image captioning, visual question answering, and (iii) vision tasks, such as image recognition with descriptions (specifying classification via text instructions). We also show that MLLMs can benefit from cross-modal transfer, i.e., transfer knowledge from language to multimodal, and from multimodal to language. In addition, we introduce a dataset of Raven IQ test, which diagnoses the nonverbal reasoning capability of MLLMs.

연구 동기 및 목표

  • 멀티모달 인지와 언어 모델의 정렬이 artificial general intelligence를 향한 필요성을 제시한다는 점을 동기 부여한다.
  • 파인튜닝 없이도 일반 모달리티를 인지하고 지시를 따르며 맥락 내에서 학습할 수 있는 모델을 개발한다.
  • 언어 모델이 모달리너 간의 보편적 작업 인터페이스로 작동할 수 있음을 보여준다.
  • 언어 전용과 다중 모달 능력 간의 교차 모달 전이의 이점을 보여준다.
  • MLLM를 위한 벤치마크와 새로운 Raven IQ 스타일 비언어적 추론 데이터셋을 제공한다.

제안 방법

  • 웹 규모의 멀티모달 코퍼스(교차 텍스트-이미지 데이터, 이미지-자막 쌍, 텍스트 전용 데이터 포함)에서 Kosmos-1을 처음부터 학습한다.
  • 트랜스포머 기반의 인과적 언어 모델을 핵심 인터페이스로 사용하고 다중 모달 입력을 임베딩한다.
  • 안정성과 긴 컨텍스트 모델링을 개선하기 위해 Magneto 백본과 xPos 상대 위치 인코딩을 채택한다.
  • 다중 모달에서의 다음 토큰 예측으로 선학습하되, 훈련을 위해 이산 토큰 손실은 유지한다.
  • 지시 이행을 개선하고 다중 모달 작업으로의 전이를 촉진하기 위해 언어 전용 지시 튜닝을 수행한다.

실험 결과

연구 질문

  • RQ1멀티모달 대형 언어 모델(MLLM)이 지각과 언어 모델을 정렬하여 파인튜닝 없이 언어 및 비전 작업을 모두 수행할 수 있는가?
  • RQ2교차 모달 전이가 언어 및 지각-언어 작업을 얼마나 개선할 수 있으며, 그 반대의 경우도 같은가?
  • RQ3MLLM은 텍스트 전용 모델과 비교했을 때 비언어적 추론, OCR-프리 작업, 지각 기반 추론을 얼마나 잘 처리하는가?

주요 결과

  • Kosmos-1은 그래디언트 업데이트 없이 언어, 지각-언어, 비전 작업에서 제로샷 및 소수샷 능력을 보여준다.
  • 모델은 교차 모달 전이의 이점을 누리며, 언어 및 다중 모달 능력이 서로를 보완한다.
  • 레이븐 IQ 스타일의 비언어 추론 벤치마크에서 Kosmos-1이 제로샷 비언어 추론을 수행할 수 있음을 보여 주며, 비전-텍스트 맥락에서의 추상 패턴 인식을 나타낸다.
  • 렌더링된 텍스트 및 웹 페이지 이해와 같은 OCR-프리 작업이 외부 도구 없이도 Kosmos-1으로 가능하다.
  • 다중 모달 사고의 흐름(멀티모달 체인-오브-생각) 프롬프트는 최종 답변 전에 중간 합리화를 생성함으로써 지각-언어 작업에서의 성능을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.