Skip to main content
QUICK REVIEW

[논문 리뷰] PaD: Program-aided Distillation Can Teach Small Models Reasoning Better than Chain-of-thought Fine-tuning

Xuekai Zhu, Biqing Qi|arXiv (Cornell University)|2023. 05. 23.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 프로그램 보조 추론 데이터를 대규모 언어 모델(Large Language Models, LLMs)에서 생성하고, 해석기를 통해 자동으로 오류를 점검함으로써 소형 모델의 추론 능력을 향상시키는 Program-aided Distillation (PaD)을 제안한다. PaD를 통해 0.06B 파라미터 모델이 GSM8K에서 LLaMA-13B와 PaLM-60B보다 뛰어난 성능을 내며, 파라미터 수는 10배 적고 데이터는 3배 적은 조건에서 10%의 정확도 향상을 달성한다.

ABSTRACT

While large language models (LLMs) excel in various natural language processing tasks, their huge size and the inaccessibility of parameters present challenges for practical deployment. Previous studies try to distill task-specific ability from LLMs to smaller models, using data synthesis and chain-of-thought (CoT) fine-tuning. However, synthetic CoT data often contains faulty reasoning, which deteriorates the quality of distillation, especially in reasoning capabilities. In this work, we propose Program-aided Distillation (PaD), which introduces reasoning programs to suppress the errors in distilled data, and thus achieves better distillation quality for reasoning tasks. In PaD, we utilize the reasoning program to substitute the CoT, allowing automated error checking of synthetic data. Further, through error injecting and further training, the small distilling model could iteratively self-refine the reasoning. Moreover, we conduct a step-wise beam search by step-by-step verifying to acquire more exact reasoning chains. We evaluate PaD on arithmetic reasoning, symbolic reasoning, and general ability. Experimental results demonstrate that smaller models using PaD can not only outperform certain LLMs~(e.g., LLaMA-1 13B) but also achieve strong improvement over baselines with a significantly smaller scale of parameters and data. The source code is publicly available at https://github.com/Xuekai-Zhu/pad.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)의 추론 능력을 효율적으로 소형 및 구현 가능한 모델로 이관하는 데 도전하는 것.
  • 체인 오브 타ught(CoT) 데이터에서 유도된 잘못된 추론 단계나 환상적인 내용이 소형 모델의 성능을 떨어뜨리는 문제를 해결하는 것.
  • 프로그램 보조 추론과 자동 오류 검사 기반으로 소형 모델의 데이터 효율성과 학습 효과를 향상시키는 것.
  • 소형 모델에 강력한 추론 능력을 부여하면서 일반 능력의 손실을 최소화하는 모델 특화를 가능하게 하는 것.

제안 방법

  • 산술 문제에 대한 단계별 추론을 나타내는 파이썬 유사 프로그램을 생성하도록 LLM에 프롬프트하여 추론 데이터를 합성한다.
  • 별도의 파이썬 해석기를 사용하여 프로그램을 컴iles하고 실행함으로써 추론 프로그램을 자동으로 검증하고, 잘못되거나 문법적으로 잘못된 샘플을 걸러낸다.
  • 계산을 해석기로 위임하여 추론과 계산을 분리함으로써 최종 답변의 정확성을 보장한다.
  • 검증된 실행 가능한 프로그램 보조 추론 데이터로 소형 모델를 미세조정하여, 검증 가능하고 구조화된 추론 패턴을 학습시킨다.
  • 데이터 정제 기법(신뢰성, GraNd, 엔트로피)을 적용하여 훈련 샘플의 중요도를 평가하고 순위를 매겨, 높은 데이터 효율성을 입증한다.
  • gpt-3.5-turbo를 사용하여 고품질의 합성 데이터를 생성하고, 신뢰성, 논리성, 정보량 등의 지표를 통해 검증한다.

실험 결과

연구 질문

  • RQ1프로그램 보조 추론 데이터 생성과 자동 오류 검사 기반의 방법이 기존 체인 오브 타ught(CoT) 미세조정 대비 소형 모델의 추론 성능 향상에 기여하는가?
  • RQ2PaD가 훨씬 적은 파라미터와 데이터를 사용하면서도 GSM8K와 같은 추론 벤치마크에서 더 큰 LLM보다 소형 모델의 성능을 뛰어나게 할 수 있는가?
  • RQ3기본적인 디스틸리케이션 및 미세조정 방법과 비교해 PaD는 데이터 효율성과 모델 특화 간의 트레이드오프 측면에서 어떻게 다른가?
  • RQ4합성된 프로그램 보조 데이터가 인간이 작성한 데이터나 CoT 생성 데이터와 비교해 의미 일관성, 논리성, 정보량 측면에서 어느 정도 유지되는가?

주요 결과

  • PaD로 훈련된 0.06B 파라미터 모델이 GSM8K 벤치마크에서 LLaMA-13B와 PaLM-60B를 초월하여 소형 모델 중 최고 성능을 기록했다.
  • PaD는 이전 베이스라인 대비 추론 정확도를 10% 향상시켰으며, 모델 크기는 1/10, 훈련 데이터는 1/3으로 줄였다.
  • 이 방법은 높은 데이터 효율성을 유지한다: 가장 중요한 90%의 훈련 샘플(신뢰성 기반 순위)만 사용해도 전체 데이터셋을 사용한 경우와 동일한 성능을 달성한다.
  • gpt-3.5-turbo에서 생성한 합성 데이터는 GSM8K 테스트 및 트레이닝 세트에서 75%의 정확도를 기록했으며, 문법 오류는 10% 미만이었고, 추론 단계의 신뢰성이 매우 높았다.
  • 해석기를 통한 검증을 통해 잘못되거나 컴파일 불가능한 프로그램을 걸러내므로, 잘못된 추론의 위험을 줄였다.
  • 추론 능력 향상에도 불구하고, 특화된 소형 모델는 일반 능력(예: BBH에서의 성능)에서 명백한 감소를 보이며, 모델 특화의 트레이드오프를 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.