[논문 리뷰] OneLLM: One Framework to Align All Modalities with Language
OneLLM는 단일한 통합 인코더와 투영 모듈을 사용하여 이미지, 비디오, 오디오, 포인트 클라우드, 깊이/노멀 맵, IMU, 그리고 fMRI를 포함한 여덟 가지 다양한 모odalities를 대규모 언어 모델과 통합하는 통합 프레임워크를 제안한다. 동적 라우팅과 모odal 토큰을 갖춘 통합 투영 모듈을 활용함으로써, 최소한의 파라미터 오버헤드로 25개의 다중모달 벤치마크에서 최신 기술 성능(SOTA)을 달성하며, 확장 가능하고 통합된 MLLM 아키텍처의 실현 가능성을 입증한다.
Multimodal large language models (MLLMs) have gained significant attention due to their strong multimodal understanding capability. However, existing works rely heavily on modality-specific encoders, which usually differ in architecture and are limited to common modalities. In this paper, we present OneLLM, an MLLM that aligns eight modalities to language using a unified framework. We achieve this through a unified multimodal encoder and a progressive multimodal alignment pipeline. In detail, we first train an image projection module to connect a vision encoder with LLM. Then, we build a universal projection module (UPM) by mixing multiple image projection modules and dynamic routing. Finally, we progressively align more modalities to LLM with the UPM. To fully leverage the potential of OneLLM in following instructions, we also curated a comprehensive multimodal instruction dataset, including 2M items from image, audio, video, point cloud, depth/normal map, IMU and fMRI brain activity. OneLLM is evaluated on 25 diverse benchmarks, encompassing tasks such as multimodal captioning, question answering and reasoning, where it delivers excellent performance. Code, data, model and online demo are available at https://github.com/csuhan/OneLLM
연구 동기 및 목표
- 기존 다중모달 LLM에서 모달리티별 전용 인코더의 한계를 해결하기 위해, 확장성과 각 모달리티에 맞는 별도 아키텍처가 필요로 하는 문제를 해결하고자 한다.
- 단일 통합 인코더와 투영 모듈이 다양한 모달리티를 대규모 언어 모델에 효과적으로 통합할 수 있는지 탐색하고자 한다.
- 각 모달리티에 대해 아키텍처 재설계 없이도 광범위한 모달리티를 지원하는 확장 가능하고 통합된 프레임워크를 개발하고자 한다.
- 효과적인 지시 테이닝을 위해 여덟 가지 모달리티를 아우르는 총 200만 건의 다중모달 지시 데이터셋을 구축하고 활용하고자 한다.
- 다양한 모달리티, 특히 저자원 모달리티인 fMRI와 IMU를 포함한 다중 모달리티 간의 공동 훈련이 파라미터 공유와 지식 전이를 통해 성능 향상에 기여하는지 입증하고자 한다.
제안 방법
- 각 입력 모달리티를 토큰 시퀀스로 변환하기 위해 단일 컨volution 레이어를 갖는 경량 모달리티 토크나이저를 제안한다.
- 학습 가능한 모달리티 토큰을 도입하여 모달리티 전환 기능을 제공하고, 변동 길이 입력을 고정된 시퀀스 길이로 정규화한다.
- 고정된 CLIP-ViT 백본을 기반으로 한 통합 인코더가 모든 모달리티 간 공통 표현 학습자로 기능한다.
- 다양한 이미지 투영 전문가들을 혼합하고 동적 라우터를 사용해 전문가 기여도를 게이팅함으로써 소프트 모의 전문가(soft mixture-of-experts)로 통합 투영 모듈(UPM)을 구성한다.
- 모델은 점진적으로 훈련된다: 먼저 시각 LLM을 사전 훈련한 후, UPM과 모달리티별 튜닝을 통해 다른 모달리티로 확장한다.
- 8개의 모달리티를 아우르는 총 200만 건의 샘플을 포함한 대규모이고 다양한 지시 데이터셋을 구축하여 종단 간 지시 테이닝을 수행한다.

실험 결과
연구 질문
- RQ1단일 통합 인코더가 오디오, 비디오, 포인트 클라우드, IMU, fMRI와 같은 다양한 비시각 모달리티를 대규모 언어 모델과 효과적으로 표현하고 통합할 수 있는가?
- RQ2동적 라우팅을 갖춘 통합 투영 모듈이 파라미터 효율성과 일반화 능력 측면에서 모달리티별 전용 투영 헤드보다 우월한가?
- RQ3fMRI와 IMU와 같이 데이터가 적은 저자원 모달리티를 포함한 다중 모달리티 간의 공동 훈련이 파라미터 공유와 지식 전이를 통해 성능 향상에 기여하는가?
- RQ4공통 구성 요소를 갖춘 통합 프레임워크가 다양한 벤치마크에서 성능을 유지하거나 향상시키면서 아키텍처 복잡성을 얼마나 줄이는가?
- RQ5확장성, 파라미터 효율성, 모달리티 커버리지 측면에서 기존의 MLLM에 비해 제안된 프레임워크는 어떻게 비교되는가?
주요 결과
- OneLLM는 여덟 가지 모달리티를 아우르는 25개의 다양한 다중모달 벤치마크에서 최신 기술 성능(SOTA)을 달성하며, 캡션 생성, 질의 응답, 추론 작업 등 다양한 작업 유형에서 뛰어난 성능을 보였다.
- fMRI와 IMU와 같은 저자원 모달리티에서도 뛰어난 성능을 기록하여, 파라미터 공유와 공동 훈련의 이점이 뚜렷하게 드러났다.
- 제거 실험(ablation study) 결과, 통합 프레임워크를 통해 모든 모달리티를 공동으로 훈련함으로써 성능 향상이 이루어지며, 특히 자료가 부족한 모달리티에서 두드러진다.
- OneLLM는 인코더에 단지 0.6B 파라미터와 단일 투영 모듈만을 사용하여, 이전의 모달리티별 구성 요소를 갖춘 모델보다 훨씬 적은 파라미터를 사용한다.
- 동적 라우팅을 갖춘 통합 투영 모듈은 효과적인 다중모달 적응을 가능하게 하여, 고정 또는 모달리티별 투영 헤드보다 뛰어난 성능을 낸다.
- 구축한 200만 건의 지시 데이터셋은 모든 여덟 가지 모달리티에서 강력한 지시 따르기 능력을 제공하며, 다양한 작업 간 일관된 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.