Skip to main content
QUICK REVIEW

[논문 리뷰] Teaching Small Language Models to Reason

Lucie Charlotte Magister, Jonathan Mallinson|arXiv (Cornell University)|2022. 12. 16.
Topic Modeling인용 수 7
한 줄 요약

이 논문은 체인 오브 타ught(CoT) 출력에 대한 피니팅을 통해 대규모 언어 모델(LLM)에서 소규모 모델로 지식 distillation을 제안하며, 산술, 일반지식, 기호 추론 작업에서 추론 성능을 크게 향상시킨다. PaLM 540B와 GPT-3 175B의 CoT 데이터에 대해 T5 XXL를 피니팅하면 GSM8K에서 정확도가 각각 8.11%에서 21.99% 및 18.42%로 향상되며, 이는 추론 능력이 소규모 모델로도 이식될 수 있음을 보여준다.

ABSTRACT

Chain of thought prompting successfully improves the reasoning capabilities of large language models, achieving state of the art results on a range of datasets. However, these reasoning capabilities only appear to emerge in models with a size of over 100 billion parameters. In this paper, we explore the transfer of such reasoning capabilities to models with less than 100 billion parameters via knowledge distillation. Specifically, we finetune a student model on the chain of thought outputs generated by a larger teacher model. Our experiments show that the proposed method improves task performance across arithmetic, commonsense and symbolic reasoning datasets. For example, the accuracy of T5 XXL on GSM8K improves from 8.11% to 21.99% when finetuned on PaLM-540B generated chains of thought.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)의 추론 능력이 지식 distillation을 통해 소규모 모델로 이식될 수 있는지 조사하기.
  • CoT distillation 이후 학생 모델 크기와 데이터셋 크기가 추론 성능에 미치는 영향을 평가하기.
  • 소수 예측 프롬프트에 목표 정답을 제공하는 것이 CoT 품질 향상에 기여하는지 확인하기.
  • 대규모 LLM의 고품질 CoT 출력에 소규모 모델을 피니팅하여 다양한 추론 벤치마크에서 작업 정확도를 향상시키는 것을 입증하기.

제안 방법

  • 8개의 예시를 포함한 소수 예측 프롬프트를 사용하여 대규모 교사 모델(PaLM 540B 및 GPT-3 175B)을 통해 기존 데이터셋에 대한 체인 오브 타ught(CoT) 추론 단계를 생성한다.
  • 질문 뒤에 목표 정답을 추가하여 소수 예측 프롬프트를 수정함으로써 추론 오류 수정이 가능해져 CoT 품질을 향상시킨다.
  • 정답과 추론 출력을 비교하여 잘못된 CoT 예시를 걸러내어, distillation에 사용되는 데이터가 고품질임을 보장한다.
  • 입력으로 질문, 목표로 CoT 이후 정답을 사용하는 teacher forcing 방식으로 소규모 학생 모델(T5 XXL, XL, base)을 피니팅한다.
  • 추론 시 동일한 프롬프트 형식을 사용하여, 학생 모델이 추론을 생성할 때 프롬프트 없이도 CoT를 생성하도록 한다.
  • 표준 정확도 메트릭을 사용하여 산술, 일반지식, 기호 추론 데이터셋에서 성능을 평가한다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델의 추론 능력이 지식 distillation을 통해 소규모 모델로 효과적으로 이식될 수 있는가?
  • RQ2CoT distillation 이후 학생 모델 크기가 성능에 미치는 영향은 어떠한가?
  • RQ3데이터셋 크기가 CoT distillation의 효과성에 어떤 영향을 미치는가?
  • RQ4소수 예측 프롬프트에 목표 정답을 포함시키는 것이 생성된 CoT의 품질과 최종 성능 향상에 기여하는가?
  • RQ5교사 모델 선택(PaLM 540B 대비 GPT-3 175B)이 distillation 성능에 어떤 영향을 미치는가?

주요 결과

  • PaLM 540B가 생성한 CoT 데이터에 대해 T5 XXL를 피니팅하면 GSM8K에서 정확도가 8.11%에서 21.99%로 향상된다.
  • GPT-3 175B의 CoT 데이터에 대해 T5 XXL를 피니팅하면 GSM8K 정확도가 18.42%로 향상된다.
  • T5 base는 T5 XXL보다 44배 적은 파라미터를 가지나, CoT 데이터에 대해 피니팅된 후 기준 T5 XXL와 유사한 성능을 달성한다.
  • 외부 계산기 제공 시 T5 small조차도 기준 T5 XXL를 초월하는 성능을 보이며, 강력한 추론 전이가 이루어졌음을 시사한다.
  • 이 방법은 6배 더 데이터 효율적이다: GSM8K 데이터의 20%만으로도 기준 모델의 8.11% 대비 11.22%의 정확도를 달성한다.
  • 성능 향상은 산술 추론 작업에서 가장 두드러지며, 기존 모델의 사실 지식 한계로 인해 StrategyQA에서는 제한된 성능 향상이 관찰된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.