[論文レビュー] AMMUS : A Survey of Transformer-based Pretrained Models in Natural Language Processing
NLPにおけるトランスフォーマーベースの事前学習済み言語モデル(T-PTLMs)に関する包括的な調査であり、自己教師あり学習、事前学習方法、埋め込み、アーキテクチャ、下流適応、ベンチマーク、ライブラリ、将来の方向性を詳述する。
Transformer-based pretrained language models (T-PTLMs) have achieved great success in almost every NLP task. The evolution of these models started with GPT and BERT. These models are built on the top of transformers, self-supervised learning and transfer learning. Transformed-based PTLMs learn universal language representations from large volumes of text data using self-supervised learning and transfer this knowledge to downstream tasks. These models provide good background knowledge to downstream tasks which avoids training of downstream models from scratch. In this comprehensive survey paper, we initially give a brief overview of self-supervised learning. Next, we explain various core concepts like pretraining, pretraining methods, pretraining tasks, embeddings and downstream adaptation methods. Next, we present a new taxonomy of T-PTLMs and then give brief overview of various benchmarks including both intrinsic and extrinsic. We present a summary of various useful libraries to work with T-PTLMs. Finally, we highlight some of the future research directions which will further improve these models. We strongly believe that this comprehensive survey paper will serve as a good reference to learn the core concepts as well as to stay updated with the recent happenings in T-PTLMs.
研究の動機と目的
- T-PTLMsにおける自己教師あり学習(SSL)とその役割の要約を提供する。
- 事前学習、事前学習タスク、埋め込み、および下流適応手法の核となる概念を説明する。
- T-PTLMsの分類法を導入し、主要なベンチマークと評価実践を要約する。
- T-PTLMsの活用に役立つライブラリとツールを調査する。
- T-PTLMsの今後の研究方向を強調し、継続的な開発を指針とする。
提案手法
- 事前学習コーパス、アーキテクチャ、SSLタイプ、拡張という4つの観点から新しいT-PTLM分類を提案する。
- 事前学習手法(Scratchからの事前学習、継続的事前学習、同時事前学習、タスク適応事前学習、知識継承事前学習)をレビューする。
- 事前学習タスク(例:CLM、MLM、RTD)と埋め込み方式(WordPiece、BPE、SentencePiece)を概説し、ドメイン固有および多言語の考慮を含む。
- 下流適応アプローチ(特徴量ベース、ファインチューニング、プロンプトベースの調整)と効率性の考慮をレビューする。
- 内在評価と外在評価ベンチマークを要約し、T-PTLM作業に役立つライブラリを挙げる。
- 効率性、堅牢性、プライバシー、公平性、ベンチマーク開発などの将来の方向性について論じる。
実験結果
リサーチクエスチョン
- RQ1トランスフォーマーベースの言語モデルにおける主要な事前学習パラダイムは何であり、それらはコストと性能の面でどのように異なるのか?
- RQ2提案された分類は、コーパス、アーキテクチャ、SSLタイプ、拡張という観点でT-PTLMをどのように分類するのか?
- RQ3標準的な下流適応手法は何であり、それらは転移性能にどう影響するのか?
- RQ4T-PTLMを評価・導入する上で最も関連性の高いベンチマークとライブラリは何か、今後の課題としてどのようなギャップが残っているのか?
主な発見
- 本調査は、4軸(事前学習コーパス、アーキテクチャ、SSLタイプ、拡張)にわたるT-PTLMの分類を統合している。
- 5つの事前学習手法ファミリー(PTS、CPT、SPT、TAPT、KIPT)とコストおよびドメイン適応のトレードオフを概説する。
- さまざまな事前学習タスク(例:CLM、MLM、RTD)と埋め込み戦略(WordPiece、BPE、SentencePiece)を、ドメインおよび多言語の観点を含めて論じる。
- 特徴量ベース、ファインチューニング、プロンプトベースの調整といった下流適応手法および効率化アプローチを扱う。
- 内在評価と外在評価のフレームワークを示し、T-PTLMエコシステムで用いられるライブラリとツールを強調し、将来の研究方向を提示する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。