[논문 리뷰] Towards a Unified Foundation Model: Jointly Pre-Training Transformers on Unpaired Images and Text
이 논문은 모달리티별 토크나이저, 공유된 트랜스포머 인코더, 그리고 작업별 헤드를 사용하여 쌍이 맞지 않는 이미지와 텍스트에서 함께 사전 훈련하는 통합 기초 트랜스포머인 ViT-BERT를 제안한다. 사전 훈련된 BERT와 ViT 교사 모델로부터 지식 정복을 도입하고, 다중 모달 학습을 균형 있게 유지하기 위해 기울기 마스킹 전략을 적용하여 시각 및 NLP 벤치마크에서 별도의 모델과 유사한 성능을 달성한다.
In this paper, we explore the possibility of building a unified foundation model that can be adapted to both vision-only and text-only tasks. Starting from BERT and ViT, we design a unified transformer consisting of modality-specific tokenizers, a shared transformer encoder, and task-specific output heads. To efficiently pre-train the proposed model jointly on unpaired images and text, we propose two novel techniques: (i) We employ the separately-trained BERT and ViT models as teachers and apply knowledge distillation to provide additional, accurate supervision signals for the joint training; (ii) We propose a novel gradient masking strategy to balance the parameter updates from the image and text pre-training losses. We evaluate the jointly pre-trained transformer by fine-tuning it on image classification tasks and natural language understanding tasks, respectively. The experiments show that the resultant unified foundation transformer works surprisingly well on both the vision-only and text-only tasks, and the proposed knowledge distillation and gradient masking strategy can effectively lift the performance to approach the level of separately-trained models.
연구 동기 및 목표
- 단일 트랜스포머 모델을 시각 및 자연어 처리 작업에 동시에 적용할 수 있는지 탐색한다.
- 모달리티 간 정렬 없이 쌍이 맞지 않는 이미지 및 텍스트 데이터에서의 공동 사전 훈련에 도전한다.
- 단일 모델 아키텍처를 공유할 때 시각 및 텍스트 작업의 성능 저하를 최소화한다.
- 충돌하는 기울기 신호와 제한된 감독 신호가 있는 다중 모달 사전 훈련을 효과적으로 가능하게 하는 기법을 개발한다.
- 통합 모델이 하류 작업에서 별도로 사전 훈련된 BERT와 ViT와 유사한 성능을 달성할 수 있는지 검증한다.
제안 방법
- 이미지와 텍스트에 대해 모달리티별 토크나이저, 공유된 트랜스포머 인코더, 작업별 헤드를 갖춘 통합 트랜스포머 아키텍처를 설계한다.
- 별도로 사전 훈련된 BERT와 ViT를 교사 모델로 사용하여 공동 훈련 중 지식 정복 신호를 제공한다.
- 기울기 크기를 기반으로 매개변수를 선택적으로 업데이트하는 기울기 마스킹 전략을 적용하여, 점차 마스크를 희박하게 만들어 시각 및 텍스트 사전 훈련 간 균형을 맞춘다.
- 두 모달리티의 손실을 조합하여 쌍이 맞지 않는 이미지-텍스트 데이터(예: 위키백과)에서 끝에서 끝까지 모델을 훈련시킨다.
- 훈련 중에 마스크 희박성을 점차 증가시키며, 텍스트 사전 훈련에 더 높은 기울기 크기를 가진 매개변수를 우선시한다.
- 하류 시각 및 NLP 작업에서 통합 모델을 미세 조정하여 전이 가능성 평가를 수행한다.
실험 결과
연구 질문
- RQ1쌍이 맞지 않는 이미지와 텍스트에서 효과적으로 사전 훈련된 단일 트랜스포머 모델이 시각 및 언어 작업을 위한 통합 기초 모델로 기능할 수 있는가?
- RQ2사전 훈련된 BERT와 ViT에서의 지식 정복은 공동 사전 훈련 성능을 어떻게 향상시키는가?
- RQ3기울기 마스킹 전략은 시각 및 텍스트 사전 훈련 목표에서 유래하는 충돌하는 최적화 신호를 효과적으로 조율할 수 있는가?
- RQ4통합 모델이 하류 작업에서 별도로 훈련된 BERT와 ViT의 성능에 얼마나 가까이 도달하는가?
- RQ5트랜스포머 인코더의 공유 표현 공간이 다중 모달 의미 정렬을 지원하는가?
주요 결과
- 공동 사전 훈련된 ViT-BERT 모델은 이미지 분류 및 자연어 이해 작업 모두에서 뛰어난 성능을 보이며, 별도로 사전 훈련된 BERT와 ViT의 성능에 근접한다.
- 사전 훈련된 BERT와 ViT에서의 지식 정복은 공동 사전 훈련 중에 학습된 표현의 질을 크게 향상시킨다.
- 기울기 마스킹 전략은 시각 및 텍스트 사전 훈련 간 학습 신호를 효과적으로 균형 잡아 성능 저하를 감소시킨다.
- 트랜스포머 인코더의 상위 레이어는 이미지와 텍스트 양쪽 모두에 의해 활성화되는 공유된 고수준 표현을 개발하여 다중 모달 의미 정렬을 나타낸다.
- 더 깊은 트랜스포머 블록에서 마스크 희박성이 더 빠르게 증가하여 고수준 특징이 두 모달 간 매개변수 공유에 더 적합함을 시사한다.
- 정성적 분석 결과, 깊은 블록의 뉴런들이 이미지와 텍스트에서 의미적으로 유사한 개념(예: 이미지의 '고양이'와 단어 '고양이')에 대해 함께 활성화된다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.