Skip to main content
QUICK REVIEW

[論文レビュー] Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models

Avi Singh, John D. Co-Reyes|arXiv (Cornell University)|Dec 11, 2023
Topic Modeling被引用数 6
ひとこと要約

本稿では、スカラーフィードバックを用いたモデル生成の合成データを活用する自己学習手法ReST EMを提案する。反復的に解法を生成し、正誤フィードバックでフィルタリングし、高品質な出力で微調整することで、MATHおよびAPPSベンチマーク上で言語モデルの性能を顕著に向上させる。人間データによる微調整を上回り、特にスケールが大きい場合に顕著な向上を示し、計算コストは最小限で、保留されたタスクでは性能の低下も見られない。

ABSTRACT

Fine-tuning language models~(LMs) on human-generated data remains a prevalent practice. However, the performance of such models is often limited by the quantity and diversity of high-quality human data. In this paper, we explore whether we can go beyond human data on tasks where we have access to scalar feedback, for example, on math problems where one can verify correctness. To do so, we investigate a simple self-training method based on expectation-maximization, which we call ReST$^{EM}$, where we (1) generate samples from the model and filter them using binary feedback, (2) fine-tune the model on these samples, and (3) repeat this process a few times. Testing on advanced MATH reasoning and APPS coding benchmarks using PaLM-2 models, we find that ReST$^{EM}$ scales favorably with model size and significantly surpasses fine-tuning only on human data. Overall, our findings suggest self-training with feedback can substantially reduce dependence on human-generated data.

研究の動機と目的

  • 言語モデルがスカラーフィードバックを用いたモデル生成の合成データを活用することで、人間がアノテートしたデータによる微調整を上回る可能性があるかを調査すること。
  • MATHやAPPSのような複雑な問題解決ベンチマークにおける、ReST EMを用いた自己学習のスケーラビリティと有効性を評価すること。
  • 大規模モデルから得られる合成データが、人間のデータよりも小規模モデルの性能向上に効果的かどうかを特定すること。
  • ReST EMの一般化への影響、特に保留されたベンチマークや推論能力への影響を評価すること。
  • 過学習や手動で設計された報酬関数の必要性といった制限要因を同定し、それらの緩和法を検討すること。

提案手法

  • ReST EMは、(1) 生成 と (2) 改善 の2ステップを交互に繰り返す。
  • (1) 生成:各入力に対して複数の出力をモデルからサンプリングし、二値の正誤報酬を用いてフィルタリングする。
  • フィルタリングされた出力が、(2) 改善 ステップで使用される学習データセットを形成し、その後モデルを微調整する。
  • このプロセスは強化学習における期待値最大化の理論的根拠に基づく。フィードバックは報酬信号として扱われる。
  • PaLM-2モデルを複数のサイズで用い、MATHおよびAPPSデータセットの自動検証器からのフィードバックを用いて、ReST EMを適用する。
  • 数回の反復を繰り返し、アブレーションスタディでは生成サンプル数、訓練問題数、反復回数を変化させる。
  • 評価には pass@1、pass@5、pass@10、およびメジャーリティ投票といった標準指標に加え、GSM8K、ハンガリー高校最終試験、Big-Bench Hardといった保留されたベンチマークを用いる。
Figure 1: Self-training with ReST EM substantially improves test performance of PaLM 2 models on two challenging benchmarks: MATH and HumanEval. Results for other models are shown for general progress on these tasks and are typically not comparable due to difference in model scales. GPT-4 results ar
Figure 1: Self-training with ReST EM substantially improves test performance of PaLM 2 models on two challenging benchmarks: MATH and HumanEval. Results for other models are shown for general progress on these tasks and are typically not comparable due to difference in model scales. GPT-4 results ar

実験結果

リサーチクエスチョン

  • RQ1モデル生成のデータと二値フィードバックを用いた自己学習は、問題解決タスクにおいて人間がアノテートしたデータによる微調整を上回るか?
  • RQ2ReST EMはMATHおよびAPPSベンチマークにおいて、モデルサイズの増加に伴いどのようにスケーリングするか?
  • RQ3ReST EMはGSM8K、ハンガリー高校最終試験、Big-Bench Hardといった分布外のベンチマークへの一般化を向上させるか?
  • RQ4生成サンプル数、訓練問題数、ReST EM反復回数といったハイパーパrameterの影響は何か?
  • RQ5ReST EMで微調整されたモデルは、他のタスクに一般化可能であり、性能の低下を来さないか?また、GPT-4と比較して実世界の試験ではどうか?

主な発見

  • ReST EMはMATHおよびAPPSベンチマークにおいて、人間データによる微調整を顕著に上回り、モデルサイズが大きくなるほど顕著である。
  • MATHでReST EMで微調整されたPaLM-2-Lモデルは、2023年ハンガリー高校最終試験において、GPT-4を除くすべての先行モデルを上回り、高精度な手動採点結果を達成した。
  • APPSおよびMATHにおいて、pass@1、pass@5、pass@10スコアが向上し、人間データによる微調整の上回る向上を示した。
  • GSM8K、ハンガリー高校最終試験、Big-Bench Hardといった保留されたベンチマークでも性能向上が確認され、強力な一般化能力を示した。
  • 数回の反復を超えると、性能向上が鈍り、小規模な訓練問題セットにおける過学習のリスクが示唆された。
  • ReST EMは関連しないタスクでの性能低下を引き起こさず、大規模モデルから得た合成データで微調整されたモデルは、人間データよりも小規模モデルの性能向上に効果的であった。
Figure 2: ReST EM for math problem-solving . Test performance on MATH and GSM8K (transfer) for PaLM 2-S* and PaLM 2-L as a function of ReST EM iterations. We also report performance of models fine-tuned via SFT on human-generated data as a baseline. Iteration 0 corresponds to pre-trained model perfo
Figure 2: ReST EM for math problem-solving . Test performance on MATH and GSM8K (transfer) for PaLM 2-S* and PaLM 2-L as a function of ReST EM iterations. We also report performance of models fine-tuned via SFT on human-generated data as a baseline. Iteration 0 corresponds to pre-trained model perfo

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。