[論文レビュー] WeLM: A Well-Read Pre-trained Language Model for Chinese
WeLMは、多様で高品質なコーパスを用いて訓練された100億パラメータのデコーダー専用事前学習言語モデルであり、単語言語および多言語タスクにおいて強力なゼロショットおよびフェイワショット一般化を達成する。同モデルは類似サイズのモデルを上回り、最大25倍も大きなモデルと同等の性能を示す一方で、コードスイッチング理解、自己説明、自己キャリブレーションの能力を示している。
Large Language Models pre-trained with self-supervised learning have demonstrated impressive zero-shot generalization capabilities on a wide spectrum of tasks. In this work, we present WeLM: a well-read pre-trained language model for Chinese that is able to seamlessly perform different types of tasks with zero or few-shot demonstrations. WeLM is trained with 10B parameters by "reading" a curated high-quality corpus covering a wide range of topics. We show that WeLM is equipped with broad knowledge on various domains and languages. On 18 monolingual (Chinese) tasks, WeLM can significantly outperform existing pre-trained models with similar sizes and match the performance of models up to 25 times larger. WeLM also exhibits strong capabilities in multi-lingual and code-switching understanding, outperforming existing multilingual language models pre-trained on 30 languages. Furthermore, We collected human-written prompts for a large set of supervised datasets in Chinese and fine-tuned WeLM with multi-prompted training. The resulting model can attain strong generalization on unseen types of tasks and outperform the unsupervised WeLM in zero-shot learning. Finally, we demonstrate that WeLM has basic skills at explaining and calibrating the decisions from itself, which can be promising directions for future research. Our models can be applied from https://welm.weixin.qq.com/docs/api/.
研究の動機と目的
- タスク固有の微調整なしに、多様なNLPタスクに効果的に一般化できる大規模かつ高品質な中国語用事前学習言語モデルの開発。
- 高品質で多様な訓練コーパスの収集とモデルサイズのスケーリングにより、中国語NLPタスクにおけるゼロショットおよびフェイワショット性能の向上。
- 中国語、英語、日本語を含む多言語環境における、特に強力なクロスリンガルおよびコードスイッチング理解の実現。
- 解釈可能性と信頼性の向上を目的として、大規模言語モデルにおける自己説明および自己キャリブレーション能力の調査と実証。
- マルチプロンプト微調整が、未観測のタスクタイプへのゼロショット一般化に与える影響の調査。
提案手法
- WeLMは、キュレートされた100億パラメータの訓練コーパスを用いて、標準的な左から右への言語モデリング目的で、デコーダー専用の自己回帰的言語モデルとして訓練されている。
- 訓練コーパスは、ウェブテキスト、学術的執筆、多言語コンテンツなど多様なソースから慎重にキュレートされており、データソースのバランスと品質フィルタリングにより、広範なカバレッジと高品質を確保している。
- WeLMは、大規模な教師あり中国語NLPデータセットからの人間が作成したプロンプトを用いたマルチプロンプト訓練により微調整され、未観測のタスクタイプにおけるゼロショット一般化性能が向上している。
- WeLMの自己説明および自己キャリブレーション能力の評価は、自身の予測に対する説明を生成させ、出力の正しさと毒性を評価させることで実施されている。
- 記憶度の測定は、グリーディデコードを用いて訓練元テキストセグメントを正確に再現できる能力を評価し、データソースおよびトークン頻度ごとの記憶率を分析することで行われている。
- WeLMの性能は、18の単語言語中国語タスク、クロスリンガルタスク(例:翻訳、QA)、コードスイッチングベンチマークにおいて、既存モデルと比較されている。
実験結果
リサーチクエスチョン
- RQ1中国語用の大規模かつキュレートされた事前学習言語モデルは、タスク固有の微調整なしに、多様なNLPタスクにおいて強力なゼロショットおよびフェイワショット一般化を達成できるか?
- RQ2WeLMの性能は、特に中国語NLPベンチマークにおけるゼロショット能力に関して、はるかに大きなモデルと比較してどうなるか?
- RQ3WeLMは、中国語、英語、日本語を含む多言語およびコードスイッチング状況において、どの程度理解し、生成できるか?
- RQ4マルチプロンプト微調整は、未学習のタスクタイプにおけるゼロショット一般化性能を、無教師事前学習バージョンと比較して向上させられるか?
- RQ5WeLMは、自身の予測に対する説明を生成し、誤りまたは有害な出力を検出できるような、基本的な自己説明および自己キャリブレーション能力を示すか?
主な発見
- WeLMは、18の単語言語中国語NLPタスクにおいて、類似サイズの既存の事前学習モデルを上回り、25倍も大きなErnie 3.0 Titanと同等の性能を示している。
- 機械翻訳、質問応答、要約を含むクロスリンガルタスクにおいて、30言語で事前学習された多言語モデルXGLMを上回っている。
- WeLMは、中国語、英語、日本語を含む混合言語入力に対して、ゼロショットで効果的に理解し、翻訳を実行している。
- WeLMのマルチプロンプト微調整により、未観測のタスクタイプにおけるゼロショット一般化性能が向上し、無教師事前学習バージョンを上回っている。
- WeLMは、基本的な自己説明および自己キャリブレーション能力を示している:説明スタイルを模倣でき、自身の予測の正しさと有害性を正しく判断できる。
- 記憶度分析の結果、より大きなWeLMモデルはより多くの訓練コンテンツを記憶しており、頻度の高いテキストやCommon Crawlのような高頻度データソースからの記憶率が高くなっている。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。