Skip to main content
QUICK REVIEW

[논문 리뷰] Perspectives and Prospects on Transformer Architecture for Cross-Modal Tasks with Language and Vision

Andrew Shin, Masato Ishii|arXiv (Cornell University)|2021. 03. 06.
Multimodal Machine Learning Applications인용 수 7
한 줄 요약

이 논문은 언어와 시각을 통합하는 다중모달 작업에서 트랜스포머 아키텍처의 진화와 영향을 검토하며, 사전 훈련 방식과 아키텍처 혁신을 강조한다. 기존의 CNN-RNN 파이프라인에서 종단 간 트랜스포머로의 전환을 부각하고, ViT 및 ViLT와 같은 모델들을 통해 CNN을 사용하지 않는 시각 표현의 가능성을 입증하며, 효율성과 성능 향상에 기여하는 텍스트 기반 이미지 합성과 같은 생성 모델링 분야의 전망을 탐색한다.

ABSTRACT

Transformer architectures have brought about fundamental changes to computational linguistic field, which had been dominated by recurrent neural networks for many years. Its success also implies drastic changes in cross-modal tasks with language and vision, and many researchers have already tackled the issue. In this paper, we review some of the most critical milestones in the field, as well as overall trends on how transformer architecture has been incorporated into visuolinguistic cross-modal tasks. Furthermore, we discuss its current limitations and speculate upon some of the prospects that we find imminent.

연구 동기 및 목표

  • 언어와 시각 간 다중모달 학습에서 트랜스포머 아키텍처의 전환적 역할을 분석하기 위해.
  • 사전 훈련 방식과 아키텍처 수정이 시각어휘적 작업 성능에 어떻게 향상되었는지 검토하기 위해.
  • 합성 신경망을 사용하지 않고 순수한 트랜스포머 기반의 시각 인코더로 CNN을 대체할 수 있는 잠재력을 조사하기 위해.
  • 텍스트 기반 이미지 합성과 같은 새로운 생성 다중모달 모델링 가능성을 탐색하기 위해.
  • 하이브리드 CNN-RNN 또는 CNN-트랜스포머 접근 방식 대비 순수 트랜스포머 기반 모델의 계산 효율성과 확장성 평가하기 위해.

제안 방법

  • 비전 및 언어 분야의 주요 이정표, 즉 BERT, GPT, ViT, ViLBERT 등을 조사하여 다중모달 모델링의 진화를 추적하기 위해.
  • 교차 주의 메커니즘과 모odal별 토큰화를 포함한, 공동 언어-시각 표현을 위한 트랜스포머 아키텍처의 적응을 분석하기 위해.
  • 멀티모달 환경에서 마스크된 언어 모델링과 대비 학습과 같은 사전 훈련 목표를 평가하기 위해.
  • 패치 임bed딩과 자기주도 주의를 사용하여 합성 신경망 특징 추출을 대체하는, 비전 트랜스포머(ViT)와 ViLT와 같은 CNN을 사용하지 않는 시각 모델을 검토하기 위해.
  • 디퓨전 또는 GAN 기반 이미지 생성과 함께 트랜스포머 기반 언어 모델을 결합한 DALL·E와 StyleCLIP와 같은 생성 응용 사례를 검토하기 위해.
  • ViT와 ResNets를 비교하는 벤치마크를 통해 계산 효율성과 메모리 사용량을 평가하며, 성능-비용 균형을 향상시키기 위한 정규화 기법을 포함하기 위해.
Figure 1: A brief timeline showing important models in vision (upper) and language (lower) domains respectively, and how they have affected approaches in cross-modal domains (middle).
Figure 1: A brief timeline showing important models in vision (upper) and language (lower) domains respectively, and how they have affected approaches in cross-modal domains (middle).

실험 결과

연구 질문

  • RQ1트랜스포머 아키텍처는 비전 및 언어 작업의 다중모달 모델 설계에 어떻게 변화를 주었는가?
  • RQ2순수한 트랜스포머 기반의 시각 인코더가 다중모달 학습에서 합성 신경망을 얼마나 효과적으로 대체할 수 있는가?
  • RQ3멀티모달 환경에서의 주요 사전 훈련 방식—특히 마스크된 언어 모델링과 대비 학습—의 차이점과 장점은 무엇인가?
  • RQ4종단 간 트랜스포머 전용 모델이 계산 효율성을 향상시키면서도 최첨단 성능을 달성할 수 있는가?
  • RQ5텍스트 기반 이미지 합성과 같은 생성 다중모달 작업의 전망은 트랜스포머 기반 아키텍처를 통해 어떻게 전개될 수 있는가?

주요 결과

  • 비전 트랜스포머(ViT)는 ResNets와 유사한 성능를 달성하면서도 메모리 사용량이 최대 4배 적어, 시각 표현에서 CNN을 대체할 잠재력이 높다는 것을 시사한다.
  • ViLT와 UniT와 같은 모델들은 종단 간 트랜스포머 전용 아키텍처가 CNN-RNN 기반 모델을 따라잡거나 뛰어넘을 수 있음을 보여주며, 추론 속도가 최대 60배 빨라질 수 있다.
  • 수동으로 레이블링된 데이터셋에서의 사전 훈련은 약한 감독 사전 훈련보다 데이터 효율성이 높지만, 충분한 데이터량이 확보되면 대규모 약한 감독 학습이 이를 상쇄할 수 있다.
  • 목표 작업에 특화된 데이터셋에서의 미세조정은 일반적인 사전 훈련보다 더 높은 성능을 보이며, 작업에 특화된 적응의 중요성을 강조한다.
  • DALL·E와 StyleCLIP와 같은 생성 모델들은 GPT-3 기반 언어 모델이 이산 VAE 토큰화를 통해 텍스트 프롬프트에서 다양하고 고품질의 이미지를 생성할 수 있음을 보여준다.
  • CNN을 사용하지 않고 순수한 트랜스포머 기반 모델의 출현은 다중모달 학습을 위한 통합적이고 하드웨어 최적화된 아키텍처로의 패러다임 전환을 시사한다.
Figure 2: Visualization of representative cross-modal models in terms of dataset size used for pre-training, performance as measured by VQA task, the type of pre-training objectives employed, and the model size. The size of block for respective model corresponds to the size of the model, as approxim
Figure 2: Visualization of representative cross-modal models in terms of dataset size used for pre-training, performance as measured by VQA task, the type of pre-training objectives employed, and the model size. The size of block for respective model corresponds to the size of the model, as approxim

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.