Skip to main content
QUICK REVIEW

[논문 리뷰] Learning From Mistakes Makes LLM Better Reasoner

Shengnan An, Zexiong Ma|arXiv (Cornell University)|2023. 10. 31.
Artificial Intelligence in Law인용 수 5
한 줄 요약

이 논문은 대규모 언어 모델(Large Language Models, LLMs)의 few-shot 추론 성능을 향상시키기 위해 잘못된 추론 경로와 그 수정 사례를 바탕으로 미세조정하는 LeMa라는 방법을 제안한다. 모델은 잘못된 추론 경로와 그 수정 사례를 통해 학습한다. GPT-4를 활용해 고품질의 수정 데이터를 생성하고 보정 중심의 진화 전략을 적용함으로써, LeMa는 다양한 LLM과 작업에서 추론 성능을 향상시켜 GSM8K 및 MATH 벤치마크에서 최신 기준 성능을 달성한다.

ABSTRACT

Large language models (LLMs) recently exhibited remarkable reasoning capabilities on solving math problems. To further improve their reasoning capabilities, this work explores whether LLMs can LEarn from MistAkes (LEMA), akin to the human learning process. Consider a human student who failed to solve a math problem, he will learn from what mistake he has made and how to correct it. Mimicking this error-driven learning process, LEMA incorporates mistake-correction data pairs during fine-tuning LLMs. Specifically, we first collect inaccurate reasoning paths from various LLMs, and then employ GPT-4 as a ''corrector'' to identify the mistake step, explain the reason for the mistake, correct the mistake and generate the final answer. In addition, we apply a correction-centric evolution strategy that effectively expands the question set for generating correction data. Experiments across various LLMs and reasoning tasks show that LEMA effectively improves CoT-alone fine-tuning. Our further ablations shed light on the non-homogeneous effectiveness between CoT data and correction data. These results suggest a significant potential for LLMs to improve through learning from their mistakes. Our code, models and prompts are publicly available at https://github.com/microsoft/LEMA.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)이 인간의 오류 기반 학습과 유사하게 자신의 실수에서 학습함으로써 추론 능력을 향상시킬 수 있는지 조사하는 것.
  • LLM에서 수집한 정확하지 않은 추론 경로를 바탕으로 오류를 식별하고 설명하며 수정하는 데 GPT-4를 사용자로 삼아 고품질의 오류-수정 데이터 쌍을 생성하는 것.
  • 보편적인 일반화를 위해 다소 어려운 문제에 초점을 맞춘 보정 중심의 진화 전략을 개발하는 것.
  • 다양한 오픈소스 LLM과 추론 작업(수학 및 일반 지식 추론 포함)에서 LeMa의 효과성을 평가하는 것.
  • 수정 데이터의 각 구성 요소—오류 단계, 설명, 수정된 해결책—이 모델 성능에 기여하는 바를 분석하는 것.

제안 방법

  • 수학 문제에서 다양한 LLMs(예: LLaMA, GPT 시리즈)로부터 정확하지 않은 추론 경로를 수집하여 오류 사례로 활용한다.
  • GPT-4를 '수정자'로 활용하여 세 부분으로 구성된 수정 데이터를 생성한다: (1) 잘못된 단계, (2) 잘못됨을 설명하는 이유, (3) 올바른 최종 답변을 포함한 수정된 추론 경로.
  • 인간 평가를 통해 잘못된 최종 답변을 포함한 수정 사례를 걸러내어 데이터 품질을 확보한다.
  • 보정 중심의 진화 전략을 적용하여 다소 어려운 문제를 시드로 선택해 새로운 수정 데이터를 생성함으로써 데이터 다양성과 유용성을 향상시킨다.
  • 사슬 추론(Chain-of-Thought, CoT) 데이터와 수정 데이터를 혼합한 데이터셋을 사용해 LLM을 미세조정함으로써, 모델이 올바른 추론과 오류 수정 양쪽 모두에서 학습할 수 있도록 한다.
  • 각 수정 구성 요소의 기여도를 분리하고 데이터 선택 전략을 평가하기 위해 추론 실험(ablation study)를 실시한다.

실험 결과

연구 질문

  • RQ1LLM은 인간의 오류 기반 학습과 유사하게 자신의 실수에서 학습함으로써 추론 능력을 향상시킬 수 있는가?
  • RQ2다양한 LLM과 추론 작업에서 LeMa의 성능는 표준 CoT 미세조정과 비교해 어떻게 되는가?
  • RQ3수정 데이터의 각 구성 요소—오류 단계, 설명, 수정된 해결책—가 최종 모델 성능에 기여하는 비중은 각각 얼마인가?
  • RQ4수정 데이터 생성 시 무작위 샘플링 대비 다소 어려운 문제에 집중하는 것이 더 나은 성능을 낳는가?
  • RQ5학습 데이터 크기를 동일하게 유지할 때 CoT 데이터와 수정 데이터를 혼합하는 것과 단일 데이터 소스를 사용하는 것의 성능 비교는 어떻게 되는가?

주요 결과

  • LLaMA-2-70B를 사용한 LeMa는 GSM8K에서 83.5%의 성능을 기록했고, MATH에서는 25.0%를 달성하여 CoT 전용 미세조정(81.4% 및 23.6%)을 초월했다.
  • 보정 중심의 진화 전략을 적용함으로써 LLaMA-2-70B의 MATH 성능은 25.0%에서 29.3%로 향상되었다.
  • LeMa는 WizardMath 및 MetaMath와 같은 전문화된 모델의 성능을 향상시켜 광범위한 적용 가능성을 입증했다.
  • 추론 실험 결과, 수정된 해결책이나 설명을 제거하면 성능이 크게 떨어지지만, 오류 단계를 생략하는 경우 영향이 덜한 것으로 나타나, 암묵적인 오류 위치 특정 기능이 작동하는 것으로 보인다.
  • 학습 데이터 크기를 동일하게 유지할 때 CoT 데이터와 수정 데이터를 혼합하는 것이 단일 데이터 유형을 사용하는 것보다 성능이 뛰어나, 상호 보완적 이점이 있음을 시사한다.
  • 다소 어려운 문제에 초점을 맞춘 데이터 증강 전략이 무작위 선택 대비 더 높은 품질과 더 유용한 수정 사례를 생성함으로써 더 효과적인 것으로 나타났다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.