[논문 리뷰] One Model, Multiple Modalities: A Sparsely Activated Approach for Text, Sound, Image, Video and Code
이 논문은 텍스트, 이미지, 음성, 비디오 및 코드와 같은 다양한 모odal에 대해 작업별 전용 파rameter 헤드를 희소하게 활성화하는 단일 다중모态 모델인 SkillNet을 제안한다. 각 모달에 맞게 파rameter를 특화하고 추론 시 관련된 부분만 활성화함으로써 SkillNet은 모달별 전용 모델과 동등한 성능을 달성하면서도 효율적인 자기지도 사전학습을 가능하게 하였으며, 이미지, 비디오 및 코드 작업에서 모달별 전용 기준선을 능가하고, 더 적은 활성화 파rameter를 사용하여 중국어 텍스트-이미지 검색에서 최신 기술 수준의 정확도를 달성하였다.
People perceive the world with multiple senses (e.g., through hearing sounds, reading words and seeing objects). However, most existing AI systems only process an individual modality. This paper presents an approach that excels at handling multiple modalities of information with a single model. In our "{SkillNet}" model, different parts of the parameters are specialized for processing different modalities. Unlike traditional dense models that always activate all the model parameters, our model sparsely activates parts of the parameters whose skills are relevant to the task. Such model design enables SkillNet to learn skills in a more interpretable way. We develop our model for five modalities including text, image, sound, video and code. Results show that, SkillNet performs comparably to five modality-specific fine-tuned models. Moreover, our model supports self-supervised pretraining with the same sparsely activated way, resulting in better initialized parameters for different modalities. We find that pretraining significantly improves the performance of SkillNet on five modalities, on par with or even better than baselines with modality-specific pretraining. On the task of Chinese text-to-image retrieval, our final system achieves higher accuracy than existing leading systems including Wukong{ViT-B} and Wenlan 2.0 while using less number of activated parameters.
연구 동기 및 목표
- 각 모달에 대해 별도의 모델이 필요 없이 여러 모달을 처리할 수 있는 통합 모델을 개발하는 것.
- 각 작업에 대해 관련된 모델 부분만 활성화하는 효율적이고 해석 가능한 파rameter 특화를 가능하게 하는 것.
- 희소한 파rameter 활성화가 다양한 모달에서 사전학습 효율성과 최종 성능을 향상시키는지 조사하는 것.
- 단일 모델이 계산 비용을 줄이며 정확도에서 모달별 전용 모델을 능가하거나 대체할 수 있는지 평가하는 것.
제안 방법
- SkillNet은 텍스트, 이미지, 음성, 비디오, 코드 등 서로 다른 모달에 맞게 특화된 다양한 파rameter 헤드를 사용하는 희소한 파rameter 활성화 메커니즘을 사용한다.
- 추론 시 입력 모달에 해당하는 파rameter 헤드만 활성화되고, 나머지는 비활성화되어 계산 부담이 감소한다.
- 멀티헤드 어텐션 이전에 전용 헤드를 통해 모달별로 고유한 쿼리, 키, 밸류 벡터를 생성함으로써 트랜스포머 아키텍처를 확장한다.
- 동일한 희소한 활성화 패턴을 사용하여 자기지도 사전학습을 지원함으로써 다양한 모달 간에 더 나은 초기화를 가능하게 한다.
- 사전학습은 모든 모달을 종합적으로 적용하며, 공통된 목표를 통해 작업 간 지식 전이를 가능하게 한다.
- 아키텍처는 모달에 관계없이, 새로운 모달에 최소한의 재구성으로 쉽게 확장 가능하다.
실험 결과
연구 질문
- RQ1한 개의 모델이 텍스트, 이미지, 음성, 비디오 및 코드 작업에서 다섯 개의 모달별 전용 모델과 비교해 유사한 성능을 달성할 수 있는가?
- RQ2희소하게 활성화된 파라미터 라우팅이 밀도 높은 모델에 비해 모델 효율성과 성능을 향상시키는가?
- RQ3희소한 활성화를 사용한 자기지도 사전학습이 모달별 전용 사전학습보다 더 나은 초기화를 이끌 수 있는가?
- RQ4모델이 저자원 작업인 텍스트-비디오 검색을 포함한 다양한 모달에 잘 일반화되는가?
주요 결과
- SkillNet은 텍스트 분류, 음성 인식, 텍스트-이미지 검색, 텍스트-비디오 검색, 텍스트-코드 검색의 다섯 가지 작업에서 모두 다섯 개의 모달별 전용 미세조정 모델과 유사한 성능을 달성하였다.
- 사전학습 이후 SkillNet은 이미지, 비디오 및 코드 작업에서 모달별 전용 사전학습 기준선을 능가하였으며, 텍스트-이미지 검색에서 73.59%의 정확도와 텍스트-비디오 검색에서 Recall@10이 81.77%를 기록하였다.
- 중국어 텍스트-이미지 검색에서 SkillNet은 단지 124M개의 활성화 파라미터로 테스트 세트에서 37.0%의 Recall@1을 달성하여 Wukong ${}_{ ext{ViT-B}}$ (36.7% R@1, 197M 파라미터)와 Wenlan 2.0 (34.1% R@1, 445M 파라미터)를 능가하였다.
- 사전학습은 모든 모달에서 성능을 크게 향상시켰으며, 다섯 가지 작업 중 세 가지에서 모달별 전용 사전학습보다 더 큰 성과 향상을 기록하였다.
- 희소한 활성화 메커니즘 덕분에 추론이 효율적이었으며, 각 작업에서 파라미터의 일부만 사용되어 정확도를 유지하면서도 계산 비용을 감소시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.