[논문 리뷰] Alternating Gradient Descent and Mixture-of-Experts for Integrated Multimodal Perception
이 논문은 단일 Transformer 인코더에서 이미지, 영상, 텍스트, 오디오 모델링을 통합하는 확장 가능하고 모odal별로 구분되지 않는 학습 프레임워크인 통합 다중모态 인식(IMP)을 소개한다. 교차 기울기 하강(AGD)과 전문가의 혼합(MoE)을 결합함으로써, 다양한 작업, 모달, 해상도를 번갈아가며 학습함으로써 기존 모델의 15%의 계산량으로도 최신 기준의 제로샷 영상 분류 성능(킨레틱스-400에서 77.0%)을 달성한다.
We present Integrated Multimodal Perception (IMP), a simple and scalable multimodal multi-task training and modeling approach. IMP integrates multimodal inputs including image, video, text, and audio into a single Transformer encoder with minimal modality-specific components. IMP makes use of a novel design that combines Alternating Gradient Descent (AGD) and Mixture-of-Experts (MoE) for efficient model and task scaling. We conduct extensive empirical studies and reveal the following key insights: 1) Performing gradient descent updates by alternating on diverse modalities, loss functions, and tasks, with varying input resolutions, efficiently improves the model. 2) Sparsification with MoE on a single modality-agnostic encoder substantially improves the performance, outperforming dense models that use modality-specific encoders or additional fusion layers and greatly mitigates the conflicts between modalities. IMP achieves competitive performance on a wide range of downstream tasks including video classification, image classification, image-text, and video-text retrieval. Most notably, we train a sparse IMP-MoE-L variant focusing on video tasks that achieves new state-of-the-art in zero-shot video classification: 77.0% on Kinetics-400, 76.8% on Kinetics-600, and 68.3% on Kinetics-700, improving the previous state-of-the-art by +5%, +6.7%, and +5.8%, respectively, while using only 15% of their total training computational cost.
연구 동기 및 목표
- 이미지, 영상, 텍스트, 오디오와 같은 다양한 입력을 모달별로 특화된 아키텍처 없이 통합하는 확장 가능하고 통합된 다중모달 학습 프레임워크를 설계하는 것.
- 대규모 다중모달 모델을 효율적으로 학습하는 데 도전하며, 성능 저하와 높은 계산 비용을 방지하는 것.
- 재학습이나 아키텍처 재설계 없이도 새로운 작업, 데이터셋, 손실 함수를 원활하게 통합할 수 있도록 하는 것.
- 작업 교환을 위한 AGD와 희박한 전문가 라우팅을 위한 MoE를 결합하여 모델의 일반화 능력과 파라미터 효율성을 향상시키는 것.
- 특히 제로샷 영상 동작 인식에서 다중모달 이해 분야에서 최신 기준의 성능을 달성하는 것.
제안 방법
- 모달별로 특화된 인코더 없이 단일 공유 Transformer 인코더를 사용하여 모달에 구애받지 않는 학습을 가능하게 한다.
- 학습 중에 다양한 모달, 작업, 손실 함수를 번갈아 적용함으로써 수렴성과 일반화 능력을 향상시키기 위해 교차 기울기 하강(AGD)을 적용한다.
- 효율성과 안정성을 유지하기 위해 입력 해상도, 시퀀스 길이, 배치 크기를 동적으로 번갈아가며 조정한다.
- 통합 인코더에 전문가의 혼합(MoE)을 적용하여 토큰당 희박한 전문가 활성화를 가능하게 하여 계산 비용에 비례하지 않게 모델 용량을 확장한다.
- 고성능 및 낮은 메모리 오버헤드를 위해 JAX 프리미티브를 사용해 효율적인 MoE 및 AGD 학습을 구현한다.
- 모달 간 대비 손실(이미지-텍스트, 영상-텍스트, 영상-오디오)과 분류 헤드를 조합하여 학습한다.

실험 결과
연구 질문
- RQ1다양한 모달과 작업 간의 교차 기울기 하강이 다중모달 학습에서 수렴성과 일반화 능력을 향상시키는가?
- RQ2희박한 전문가 라우팅을 통한 통합형 모달에 구애받지 않는 인코더가 다중터 전용 또는 모달별로 특화된 아키텍처보다 성능과 효율성 면에서 뛰어나게 되는가?
- RQ3희박한 MoE 라우팅이 통합 다중모달 인코더의 파라미터 병목 현상을 효과적으로 해결하면서도 모든 모달에서 정확도를 유지하는가?
- RQ4AGD가 학습 효율성을 해치지 않고 작업과 데이터셋의 점진적 확장을 얼마나 잘 지원하는가?
- RQ5희박한 단일 모델이 상당히 줄어든 계산 비용으로도 제로샷 영상 이해에서 최신 기준의 성능을 달성할 수 있는가?
주요 결과
- IMP-MoE-L 모델은 킨레틱스-400에서 77.0%의 제로샷 정확도를 달성하여 이전 최신 기준보다 +5.0% 향상되었고, 학습 계산량은 이전 모델의 15%에 불과하다.
- 킨레틱스-600에서 IMP-MoE-L은 76.8%의 정확도를 기록하여 이전 방법보다 +6.7% 향상되었으며, 동일한 낮은 계산 비용을 유지했다.
- 킨레틱스-700에서는 68.3%의 제로샷 정확도를 달성하여 +5.8% 향상되었으며, 더 큰 동작 집합에 대한 강력한 일반화 능력을 보였다.
- 단지 4명의 전문가만으로도 제로샷 이미지 분류 정확도가 크게 향상되었고, 전문가 수를 16명으로 늘리면 모든 후행 작업에서 일관된 성능 향상이 나타났다.
- 단일 타워 MoE 모델는 다중터 밀집 모델보다 파라미터 효율성과 계산 효율성이 뛰어나며, 더 적은 파라미터로도 더 높은 정확도를 달성했다.
- MoE는 모달 간 간섭을 효과적으로 완화하여, 밀집 기반 모델 대비 오디오를 추가했을 때 이미지 및 영상 성능에 미치는 부정적 영향을 줄였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.