[論文レビュー] Guess the Instruction! Flipped Learning Makes Language Models Stronger Zero-Shot Learners
この論文では、入力-ラベルペアからタスク指示を生成するように言語モデルを訓練するメタトレーニング手法「Flipped Learning」を提案する。これにより、未観測のラベルに対してもゼロショット一般化性能が向上する。11B Flippedモデルは、14のBIG-Benchタスク全体でT0-11Bを平均8.4%、3ショットGPT-3 (175B)を平均9.7%上回り、特に新規ラベルペアではF1スコアが最大20%高い。
Meta-training, which fine-tunes the language model (LM) on various downstream tasks by maximizing the likelihood of the target label given the task instruction and input instance, has improved the zero-shot task generalization performance. However, meta-trained LMs still struggle to generalize to challenging tasks containing novel labels unseen during meta-training. In this paper, we propose Flipped Learning, an alternative method of meta-training which trains the LM to generate the task instruction given the input instance and label. During inference, the LM trained with Flipped Learning, referred to as Flipped, selects the label option that is most likely to generate the task instruction. On 14 tasks of the BIG-bench benchmark, the 11B-sized Flipped outperforms zero-shot T0-11B and even a 16 times larger 3-shot GPT-3 (175B) on average by 8.4% and 9.7% points, respectively. Flipped gives particularly large improvements on tasks with unseen labels, outperforming T0-11B by up to +20% average F1 score. This indicates that the strong task generalization of Flipped comes from improved generalization to novel labels. We release our code at https://github.com/seonghyeonye/Flipped-Learning.
研究の動機と目的
- 新規ラベルを含むタスクにおけるメタトレーニング済み言語モデルの劣悪なゼロショット一般化性能を改善すること。
- 標準的なメタトレーニングパラダイム(指示からラベルを生成する)を再考し、ラベル一般化を向上させること。
- 見たことのないラベル形式への過学習を低減する、より効率的かつ効果的なゼロショット学習手法を開発すること。
- トレーニング時にラベルを条件として用いることで、未観測タスクおよびラベルのバリエーションへの一般化性能が向上することを示すこと。
提案手法
- Flipped Learningは、入力例と正しいラベルが与えられたもとで、タスク指示を予測する言語モデルを訓練する。これは、標準的な生成方向を逆転させたものである。
- 標準的なクロスエントロピー損失を用い、入力-ラベルペアに対して正しい指示の尤度を最大化する。
- 正しくないラベル選択肢に対して正しい指示を生成しないようにするため、アンリクリティ損失を適用し、識別性能を向上させる。
- 推論時、モデルはタスク指示を最もよく生成するラベルを選択する。これにより、例示なしのゼロショット予測が可能になる。
- 本手法は、T5ベースのモデルに適用され、T0の計算量の約5%、データセット数の半分で実行可能であり、効率的である。
- 本手法は52のデータセット(Flipped+)にスケーリングされ、MMLUで評価され、最小限のデータで強力な性能を示している。
実験結果
リサーチクエスチョン
- RQ1入力とラベルから指示を生成するように言語モデルを訓練することで、未観測タスクにおけるゼロショット一般化性能が向上するか?
- RQ2Flipped Learningは、'yes/no' と 'agree/disagree' のような特定のラベル形式への過学習を低減するか?
- RQ3Flipped Learningは、標準的なメタトレーニング(例:Direct)と比較して、新規ラベルペアにおける性能で優れているか?
- RQ4Flipped Learningで訓練された小さなモデルが、GPT-3 (175B) よりもはるかに大きなゼロショットモデルを上回るか?
- RQ5Flipped Learningにおけるトレーニングデータセット数の増加が、MMLUのような難易度の高いベンチマークでの性能向上に寄与するか?
主な発見
- 11B Flippedモデルは、14のBIG-Benchタスク全体でT0-11Bを平均8.4%上回り、優れたゼロショット一般化性能を示している。
- Flippedは、3ショットGPT-3 (175B) を平均9.7%上回っているが、ゼロショットモデルであり、かつはるかに小さいサイズである。
- 新規ラベルペア(例:'yes/no' 対 'agree/disagree')を含むタスクでは、FlippedはT0-11Bに比べてF1スコアを最大20%向上させ、ラベル一般化の向上を確認している。
- 52のデータセットで学習したFlipped+は、MMLUで強力な性能を発揮し、10倍のデータセットを用いたFLAN-T5との精度差を10%縮小した。
- Flippedは、14の一般的なNLPタスクにおいて、平均的にすべてのベースラインモデルを上回り、最先端のゼロショット性能を達成している。
- 本手法は効率的である:FlippedはT0の計算量の5%、データセット数の半分で、かつ優れた結果を達成している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。