Skip to main content
QUICK REVIEW

[논문 리뷰] AMMUS : A Survey of Transformer-based Pretrained Models in Natural Language Processing

Katikapalli Subramanyam Kalyan, Ajit Rajasekharan|arXiv (Cornell University)|2021. 08. 12.
Topic Modeling인용 수 149
한 줄 요약

자연어 처리에서 변환기 기반 사전학습 언어 모델(T-PTLMs)에 대한 포괄적 고찰로, 자기지도 학습, 사전학습 방법, 임베딩, 아키텍처, 다운스트림 적응, 벤치마크, 라이브러리 및 향후 방향을 자세히 다룬다.

ABSTRACT

Transformer-based pretrained language models (T-PTLMs) have achieved great success in almost every NLP task. The evolution of these models started with GPT and BERT. These models are built on the top of transformers, self-supervised learning and transfer learning. Transformed-based PTLMs learn universal language representations from large volumes of text data using self-supervised learning and transfer this knowledge to downstream tasks. These models provide good background knowledge to downstream tasks which avoids training of downstream models from scratch. In this comprehensive survey paper, we initially give a brief overview of self-supervised learning. Next, we explain various core concepts like pretraining, pretraining methods, pretraining tasks, embeddings and downstream adaptation methods. Next, we present a new taxonomy of T-PTLMs and then give brief overview of various benchmarks including both intrinsic and extrinsic. We present a summary of various useful libraries to work with T-PTLMs. Finally, we highlight some of the future research directions which will further improve these models. We strongly believe that this comprehensive survey paper will serve as a good reference to learn the core concepts as well as to stay updated with the recent happenings in T-PTLMs.

연구 동기 및 목표

  • self-supervised learning(SSL)과 T-PTLM에서의 역할에 대한 간결한 개요를 제공합니다.
  • 사전학습, 사전학습 작업, 임베딩, 다운스트림 적응 방법의 핵심 개념을 설명합니다.
  • T-PTLM의 분류 체계를 소개하고 주요 벤치마크 및 평가 관행을 요약합니다.
  • T-PTLM 작업에 유용한 라이브러리와 도구를 조사합니다.
  • T-PTLM의 지속적 개발을 안내하기 위한 향후 연구 방향을 강조합니다.

제안 방법

  • 사전학습 코퍼스, 아키텍처, SSL 유형, 확장을 기준으로 한 T-PTLM의 새로운 분류 체계를 제안합니다.
  • 사전학습 방법(처음부터 시작하는 사전학습, 연속 사전학습, 동시 사전학습, 작업 적응 사전학습, 지식 상속 사전학습)을 검토합니다.
  • 도메인 특화 및 다국어 고려를 포함하여 단어 조각(WorPiece, BPE, SentencePiece) 임베딩 체계와 예를 듭니다(예: CLM, MLM, RTD).
  • 특징 기반, 미세 조정, 프롬프트 기반 미세 조정 등 다운스트림 적응 접근법과 효율성 고려사항을 검토합니다.
  • T-PTLM 생태계에서 사용되는 라이브러리 및 도구를 포함하여 내재적/외재적 평가 벤치마크를 요약하고 유용한 라이브러리를 나열합니다.
  • 효율성, 강건성, 개인정보 보호, 공정성, 벤치마크 개발 등과 같은 향후 방향을 논의합니다.

실험 결과

연구 질문

  • RQ1트랜스포머 기반 언어 모델의 지배적인 사전학습 패러다임은 무엇이며 비용과 성능 면에서 어떻게 차이가 나나요?
  • RQ2제안된 분류 체계가 코퍼스, 아키텍처, SSL 유형, 확장을 통해 T-PTLM을 어떻게 분류하나요?
  • RQ3표준 다운스트림 적응 방법은 무엇이며 이것이 전달 성능에 어떤 영향을 미치나요?
  • RQ4평가 및 배치를 위한 벤치마크와 라이브러리는 무엇이 가장 중요하며, 향후 연구에서 어떤 격차가 남아 있나요?

주요 결과

  • 본 조사 연구는 사전학습 코퍼스, 아키텍처, SSL 유형, 확장의 네 축에 걸친 T-PTLM의 분류 체계를 통합합니다.
  • 비용 및 도메인 적응의 트레이드오프를 가진 다섯 가지 사전학습 방법 계열(PTS, CPT, SPT, TAPT, KIPT)을 개괄합니다.
  • 도메인 및 다국어 고려를 포함한 CLM, MLM, RTD와 같은 다양한 사전학습 작업 및 WordPiece, BPE, SentencePiece 임베딩 전략을 다룹니다.
  • 특징 기반, 미세 조정, 프롬프트 기반 미세 조정 등 다운스트림 적응 방법과 효율성 접근법을 다룹니다.
  • 내재적 및 외재적 평가 프레임워크를 제시하고 T-PTLM 생태계에서 사용되는 라이브러리와 도구를 강조하며 향후 연구 방향을 제시합니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.