Skip to main content
QUICK REVIEW

[논문 리뷰] ChainLM: Empowering Large Language Models with Improved Chain-of-Thought Prompting

Xiaoxue Cheng, Junyi Li|arXiv (Cornell University)|2024. 03. 21.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 사고의 사슬(Chain-of-Thought, CoT) 프롬프팅을 향상시키기 위한 프레임워크인 CoTGenius를 소개한다. CoTGenius는 세 가지 진화 전략—복잡화, 다양화, 구체화—와 함께 정확성 검증 및 성공 판단 필터링을 통합한다. 저자들은 CoTGenius를 활용해 고품질의 CoT 데이터셋을 생성하고, Llama 2-7B 및 13B 모델을 미세조정하여 ChainLM를 개발하였으며, 이는 복잡한 추론 작업에서 최신 기준 성능을 달성한다. 특히 GSM8K에서 기준 모델 대비 12.5%p의 절대적 성능 향상을 기록하였다.

ABSTRACT

Chain-of-Thought (CoT) prompting can enhance the reasoning capabilities of large language models (LLMs), establishing itself as a primary approach to solving complex reasoning tasks. Existing CoT synthesis approaches usually focus on simpler reasoning tasks and thus result in low-quality and inconsistent CoT prompts. In response to this challenge, we present an empirical investigation of CoT prompting and introduce CoTGenius, a novel framework designed for the automatic generation of superior CoT prompts. CoTGenius is developed based on three major evolution strategies, i.e., complicate, diversify, and specify-alongside two filtering mechanisms: evolutionary success judgement and correctness verification. We further employ CoTGenius to create an extensive CoT dataset, and subsequently fine-tune the Llama 2-Chat 7B and 13B models on this dataset. We call the resulting model ChainLM. To deal with the cumulative error issue in reasoning steps, we propose a step-level debating method, wherein multiple debaters discuss each reasoning step to arrive at the correct answer. Extensive experiments demonstrate that our ChainLM models exhibit enhanced proficiency in addressing a spectrum of complex reasoning problems compared to existing models. In addition, we conduct an in-depth analysis of the impact of data categories within CoTGenius on the model performance. We release our dataset and code at https://github.com/RUCAIBox/ChainLM.

연구 동기 및 목표

  • 기존 CoT 프롬프팅 방법의 한계를 해결하기 위해, 이는 복잡한 작업에서 낮은 품질, 일관성 없음, 또는 불완전한 추론 체인을 자주 생성하기 때문이다.
  • 실증 분석을 통해 추론의 완전성, 구체성, 논리적 순서가 LLM 성능에 미치는 영향을 조사하기 위해.
  • 작은 LLM의 추론 능력을 향상시키기 위한 고품질 CoT 프롬프트를 생성하는 체계적인 프레임워크를 개발하기 위해.
  • 누적 오류를 줄이기 위해 단계 수준의 논의 메커니즘을 도입하기 위해.
  • 더 넓은 연구 목적을 위해 새로운 고품질 CoT 데이터셋과 미세조정된 모델(ChainLM)을 공개하기 위해.

제안 방법

  • CoTGenius는 세 가지 진화 전략을 활용한다: 복잡화(질문의 복잡성 증가), 다양화(다양한 질문 변형 생성), 구체화(추론 단계의 세부 정보 향상)를 통해 반복적으로 CoT 프롬프트를 향상시킨다.
  • 이 프레임워크는 두 가지 필터링 메커니즘을 적용한다: 진화적 성공 판단을 통한 높은 성능을 보인 체인 유지 및 정확성 검증을 통한 추론 단계와 답변 간 일관성 확보.
  • 단계 수준의 논의 메커니즘이 도입되며, 여러 LLM이 각 추론 단계를 독립적으로 평가하고 개선한 후 최종 답변을 집계한다.
  • 저자들은 자동으로 생성된 CoT 데이터셋을 기반으로 Llama 2-7B 및 13B 모델을 미세조정하여 복잡한 추론에 최적화된 ChainLM를 개발한다.
  • GSM8K에서 실증 분석을 수행하여 CoT 체인의 완전성, 구체성, 논리적 순서의 영향을 평가한다.
  • 최종 모델은 GSM8K, AIME, SVAMP 등의 여러 추론 벤치마크에서 평가되며, 데이터 카테고리에 대한 분석도 수행된다.

실험 결과

연구 질문

  • RQ1추론 단계의 완전성, 구체성, 논리적 순서는 복잡한 추론 작업에서 LLM 성능에 어떻게 영향을 미치는가?
  • RQ2진화 전략을 통한 자동 CoT 프롬프트 생성 방식이 기존 방법보다 더 높은 품질의 추론 체인을 생성할 수 있는가?
  • RQ3단계 수준의 논의 메커니즘이 다단계 추론에서 누적 오류를 유의미하게 감소시키는가?
  • RQ4다양하고 고품질의 CoT 데이터셋에 대한 미세조정은 여러 벤치마크에서 추론 일반화 능력을 어떻게 향상시키는가?
  • RQ5다양한 데이터 카테고리(예: 수학, 논리, 일반 지식)가 최종 모델의 추론 성능에 미치는 상대적 영향은 무엇인가?

주요 결과

  • CoTGenius가 생성한 CoT 프롬프트는 기준 방법보다 뚜렷이 뛰어나며, ChainLM는 GSM8K에서 92.4%의 정확도를 기록하여 제로샷 기준 모델 대비 12.5%p의 절대적 성능 향상을 달성하였다.
  • 추론의 완전성과 구체성을 높일수록 성능 향상이 명확하게 관측되며, 복잡한 수학 문제에서는 5단계 체인이 2-또는 3단계 체인보다 뛰어난 성능을 보였다.
  • 논리적 순서—즉, 답변 이전에 추론을 수행하는 방식—은 GSM8K에서 역순(답변 이후 추론) 대비 15.3%p의 성능 향상을 가져왔다.
  • 단계 수준의 논의 메커니즘은 표준 CoT 대비 누적 오류를 28% 감소시켰으며, 특히 다단계 추론 작업에서 성능 향상에 기여했다.
  • CoTGenius가 생성한 데이터에 대한 미세조정은 제로샷 일반화 능력을 향상시켰으며, ChainLM는 AIME 및 SVAMP에서 기초 Llama 2 및 지시 미세조정 기준 모델을 모두 앞섰다.
  • 분석 결과, 데이터의 다양성과 구체성이 단순한 양보다 더 큰 영향을 미치며, 특히 복잡한 추론에서 구체성 기여도가 전체 성능 향상의 60%를 차지했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.