Skip to main content
QUICK REVIEW

[논문 리뷰] Are Pre-trained Convolutions Better than Pre-trained Transformers?

Yi Tay, Mostafa Dehghani|arXiv (Cornell University)|2021. 05. 07.
Topic Modeling참고 문헌 42인용 수 33
한 줄 요약

이 논문은 8개 NLP 태스크에 대해 사전 학습된 합성곱 Seq2Seq 모델과 사전 학습된 Transformer를 비교 평가한 결과, CNN 기반 모델이 경쟁력이 있으며 여러 설정에서 Transformer를 능가하는 경우가 많고, 사전 학습이 CNN에도 Transformer와 유사하게 이점을 준다.

ABSTRACT

In the era of pre-trained language models, Transformers are the de facto choice of model architectures. While recent research has shown promise in entirely convolutional, or CNN, architectures, they have not been explored using the pre-train-fine-tune paradigm. In the context of language models, are convolutional models competitive to Transformers when pre-trained? This paper investigates this research question and presents several interesting findings. Across an extensive set of experiments on 8 datasets/tasks, we find that CNN-based pre-trained models are competitive and outperform their Transformer counterpart in certain scenarios, albeit with caveats. Overall, the findings outlined in this paper suggest that conflating pre-training and architectural advances is misguided and that both advances should be considered independently. We believe our research paves the way for a healthy amount of optimism in alternative architectures.

연구 동기 및 목표

  • 사전 학습–미세 조정 패러다임 하에서 합성곱 아키텍처가 Transformer 기반 모델과 대등하거나 이를 능가할 수 있는지 평가한다.
  • 다양한 NLP 태스크에 걸쳐 여러 합성곱 변형(경량, 확장된, 동적)을 평가한다.
  • 정확도, 속도, 확장성 차원에서 CNN과 Transformer 간의 사전 학습 효과를 비교한다.

제안 방법

  • T5에서 영감을 받은 span 기반 시퀀스-투-시퀀스 디노이징 목표를 사용하여 사전 학습된 합성곱 Seq2Seq 모델을 개발한다.
  • 경량 depthwise 합성곱, 동적 합성곱, 확장 합성곱 등 여러 합성곱 변형을 조사한다.
  • 대규모 말뭄(C4)에서 CNN과 Transformer를 524K 스텝으로 사전 학습하고 3-토큰 span 손상으로, 그다음 다운스트림 태스크에서 미세 조정한다.
  • 독성 탐지, 감성 분석, 뉴스 분류, 질문 분류 및 구성 일반화를 포함하는 8개 데이터셋에서 평가한다.
  • 768 모델 차원과 12개의 헤드를 갖는 12층 인코더–디코더 아키텍처를 사용하고, 유사 규모의 Transformer 기준선(T5)과 비교한다.

실험 결과

연구 질문

  • RQ1합성곱이 Transformer처럼 사전 학습으로 이득을 얻는가?
  • RQ2사전 학습된 합성곱 모델이 사전 학습된 Transformer와 경쟁 가능한가, 어떤 태스크와 설정에서 잘하거나 실패하는가?
  • RQ3속도, FLOPs, 확장성 측면에서 사전 학습된 합성곱이 Transformer에 비해 어떤 실용적 이점을 제공하는가?
  • RQ4사전 학습된 합성곱의 주의점과 실패 모드는 무엇이며, 언제 피해야 하는가?
  • RQ5사전 학습 하에서 특정 합성곱 변형이 일반적으로 다른 것보다 우수한가?

주요 결과

  • 사전 학습된 합성곱은 Transformer와 경쟁력이 있으며 여러 태스크에서 이를 능가할 수 있다.
  • 8개 데이터셋에 걸쳐, 사전 학습된 합성곱은 7개 태스크 중 6개에서 최첨단 Transformer(T5)보다 우수하며, 일부 설정에서 주목할 만한 이점을 보인다.
  • 합성곱은 Transformer보다 더 빠르고 FLOP 효율적이며 더 긴 시퀀스에 대해 더 잘 확장된다.
  • 사전 학습은 CNN에도 Transformer와 유사하게 이점을 주며, 사전 학습의 이점이 Transformer 아키텍처에만 국한되지 않는다는 것을 시사한다.
  • 합성곱 변형 중 확장된(dilated) 및 동적(dyn amic) 합성곱이 많은 설정에서 일반적으로 경량 합성곱보다 더 좋은 성능을 보인다.
  • CNN의 교차 어텐션 한계는 시퀀스 간 상호 작용이 필요한 태스크를 저해할 수 있지만, 단일 교차 어텐션 레이어가 이 격차의 많은 부분을 회복할 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.