[논문 리뷰] Beyond Human Data: Scaling Self-Training for Problem-Solving with Language Models
이 논문은 문제 해결 작업에서 언어 모델의 성능을 향상시키기 위해 모델이 생성한 합성 데이터와 이진 피드백을 사용하는 자기 훈련 방법인 ReST EM을 제안한다. 반복적으로 해결책을 생성하고 정확성 피드백을 통해 필터링한 후 고품질 출력물로 미세조정하는 방식으로, MATH 및 APPS 벤치마크에서 성능을 크게 향상시켰다. 이는 인간 데이터로 미세조정하는 것보다 특히 스케일이 클수록 뛰어나며, 계산 비용은 최소화하면서도 보류된 작업에서 성능 저하가 발생하지 않는다.
Fine-tuning language models~(LMs) on human-generated data remains a prevalent practice. However, the performance of such models is often limited by the quantity and diversity of high-quality human data. In this paper, we explore whether we can go beyond human data on tasks where we have access to scalar feedback, for example, on math problems where one can verify correctness. To do so, we investigate a simple self-training method based on expectation-maximization, which we call ReST$^{EM}$, where we (1) generate samples from the model and filter them using binary feedback, (2) fine-tune the model on these samples, and (3) repeat this process a few times. Testing on advanced MATH reasoning and APPS coding benchmarks using PaLM-2 models, we find that ReST$^{EM}$ scales favorably with model size and significantly surpasses fine-tuning only on human data. Overall, our findings suggest self-training with feedback can substantially reduce dependence on human-generated data.
연구 동기 및 목표
- 언어 모델이 스칼라 피드백을 사용한 모델이 생성한 합성 데이터를 활용해 인간 데이터로 미세조정하는 것보다 뛰어날 수 있는지 조사하는 것.
- MATH 및 APPS와 같은 복잡한 문제 해결 벤치마크에서 ReST EM을 통한 자기 훈련의 확장성과 효과성을 평가하는 것.
- 더 큰 모델에서 생성한 합성 데이터가 더 작은 모델을 더 효과적으로 향상시킬 수 있는지 여부를 판단하는 것.
- ReST EM이 일반화에 미치는 영향, 특히 보류된 벤치마크와 추론 능력에서의 성능을 평가하는 것.
- 과적합 및 수작업으로 설계된 보상 함수가 필요한 등의 한계를 규명하고 이를 완화할 수 있는 방법을 탐색하는 것.
제안 방법
- ReST EM은 두 단계를 번갈아 수행한다: (1) 생성 — 각 입력에 대해 모델에서 여러 출력을 샘플링하고, 이중 정확성 피드백을 사용해 필터링한다.
- 필터링된 출력물은 (2) 향상 단계에서 사용되는 훈련 데이터셋을 형성하며, 이는 다음 반복에서 사용된다.
- 이 방법은 강화학습을 위한 기대값 최대화 이론에 기반하며, 피드백을 보상 신호로 간주한다.
- 이 방법은 MATH 및 APPS 데이터셋에서 자동 검증기로부터의 피드백을 사용해 여러 크기의 PaLM-2 모델에 적용된다.
- 몇 차례 반복하여 수행되며, 아블레이션 스터디를 통해 생성된 샘플 수, 훈련 문제 수, 반복 횟수를 다양하게 조정한다.
- 성능 평가는 pass@1, pass@5, pass@10 및 다수결 투표와 같은 표준 지표와 함께, GSM8K, 헝가리 고교 수능, Big-Bench Hard와 같은 보류된 벤치마크에서도 평가된다.

실험 결과
연구 질문
- RQ1모델이 생성한 데이터와 이진 피드백을 사용한 자기 훈련이 문제 해결 작업에서 인간에 의해 애너테이션된 데이터로 미세조정하는 것보다 우월한가?
- RQ2ReST EM은 MATH 및 APPS 벤치마크에서 모델 크기가 증가함에 따라 어떻게 확장되는가?
- RQ3ReST EM은 GSM8K, 헝가리 고교 수능, Big-Bench Hard와 같은 분포 외의 벤치마크로의 일반화를 향상시키는가?
- RQ4생성된 샘플 수, 훈련 문제 수, ReST EM 반복 횟수와 같은 하이퍼파라미터의 영향은 무엇인가?
- RQ5ReST EM으로 미세조정된 모델은 다른 작업으로 일반화될 수 있으며 성능 저하 없이 작동하는가? 또한 실세계 시험에서 GPT-4와 비교해 어떤가?
주요 결과
- ReST EM은 MATH 및 APPS 벤치마크에서 인간 데이터로 미세조정하는 것보다 뚜렷이 뛰어나며, 모델 크가 증가할수록 그 성능 향상이 두드러진다.
- MATH에서 ReST EM으로 미세조정한 PaLM-2-L 모델은 2023년 헝가리 고교 수능에서 GPT-4를 제외한 이전의 모든 모델을 초월했으며, 강력한 수작업 평가 결과를 기록했다.
- ReST EM으로 미세조정한 모델들은 APPS 및 MATH에서 pass@1, pass@5, pass@10 점수 모두 향상되었으며, 인간 데이터로 미세조정한 경우보다 성능 향상 폭이 더 크다.
- GSM8K, 헝가리 고교 수능, Big-Bench Hard와 같은 보류된 벤치마크에서도 성능 향상이 관찰되어 강력한 일반화 능력을 보였다.
- 몇 차례 반복 이후 성능 향상 폭이 감소함에 따라, 작은 훈련 문제 세트에서 과적합의 위험이 존재하는 것으로 나타났다.
- ReST EM은 관련 없는 작업에서 성능 저하를 유발하지 않았으며, 더 큰 모델에서 생성한 합성 데이터로 미세조정한 모델은 인간 데이터로 미세조정한 경우보다 더 작은 모델을 더 효과적으로 향상시켰다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.