Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Understanding Chain-of-Thought Prompting: An Empirical Study of What Matters

Boshi Wang, Sewon Min|arXiv (Cornell University)|2022. 12. 20.
Topic Modeling인용 수 9
한 줄 요약

이 논문은 사전 훈련된 추론 패턴에 의존하는 대신 진리 기반 추론 과정이 아닌 추론 단계의 관련성과 순서가 더 중요하다는 점을 규명함으로써, 소수 샘플 추론에서 체인 오브 씽크(Chain-of-Thought, CoT) 프롬프팅의 효과성을 분석한다. 특히, 시각화된 추론 단계가 잘못되었음에도 불구하고 모델 성능이 CoT 기준선의 80-90%에 이르게 되며, 이는 논리적 타당성이 떨어지는 예시조차도 효과적인 추론을 유도할 수 있음을 시사한다.

ABSTRACT

Chain-of-Thought (CoT) prompting can dramatically improve the multi-step reasoning abilities of large language models (LLMs). CoT explicitly encourages the LLM to generate intermediate rationales for solving a problem, by providing a series of reasoning steps in the demonstrations. Despite its success, there is still little understanding of what makes CoT prompting effective and which aspects of the demonstrated reasoning steps contribute to its performance. In this paper, we show that CoT reasoning is possible even with invalid demonstrations - prompting with invalid reasoning steps can achieve over 80-90% of the performance obtained using CoT under various metrics, while still generating coherent lines of reasoning during inference. Further experiments show that other aspects of the rationales, such as being relevant to the query and correctly ordering the reasoning steps, are much more important for effective CoT reasoning. Overall, these findings both deepen our understanding of CoT prompting, and open up new questions regarding LLMs' capability to learn to reason in context.

연구 동기 및 목표

  • 대규모 언어모델에서 효과적인 소수 샘플 추론을 위해 체인 오브 씽크(CoT) 시범 예시의 구성 요소 중 어떤 것이 필수적인지 이해하는 것.
  • 시범 예시의 추론 단계가 논리적으로 올바른지 여부가 모델 성능에 필수적인지 조사하는 것.
  • 다단계 추론 작업에서 성능 향상을 이끄는 CoT 추론의 핵심 특성들을 특정하는 것.
  • 정확한 추론 단계가 CoT 성공에 필수적이라는 가정을 도전하고, 형식과 구조의 역할을 탐색하는 것.

제안 방법

  • 논리적 타당성, 관련성, 단계 순서 등 다양한 구성 요소를 체계적으로 수정함으로써 CoT 시범 예시에 대한 분석 실험을 수행한다.
  • 통제된 프롬프팅 설정을 설계: '논리적 타당성 없는 추론', '일관성 없음', '관련성 없음', '순서 없음'을 통해 각 추론 구성 요소의 영향을 고립하여 분석한다.
  • 두 가지 벤치마크 작업을 사용: 산술 추론과 다단계 사실 기반 질문 응답을 통해 다양한 설정에서 모델 성능을 평가한다.
  • 정확도 일치 및 F1과 같은 표준 지표를 사용하여, 분석된 설정을 표준 CoT 및 제로샷 기준선과 비교하여 성능을 측정한다.
  • 잘못된 시범 예시 조건에서도 모델이 생성한 추론을 분석하여 일관성, 관련성, 논리적 일관성을 평가한다.
  • 다음을 정의하고 추출한다: '브리징 오브젝트'(예: 숫자, 실체)와 '언어 템플릿'(예: 관계, 술어)를 통해 이들이 추론에 미치는 영향을 분석한다.

실험 결과

연구 질문

  • RQ1CoT 시범 예시의 추론 단계가 논리적으로 타당한지 여부가 모델 성능에 뚜렷한 영향을 미치는가?
  • RQ2논리적 타당성 외에 추론의 관련성이나 순서 같은 다른 구성 요소들이 성능 향상에 더 큰 기여를 하는가?
  • RQ3잘못되거나 일관성이 없는 시범 예시를 보여주었을 때도 LLM이 효과적인 추론 경로를 생성할 수 있는가?
  • RQ4LLM에 내장된 사전 훈련된 추론 능력은 CoT 프롬프팅에서 정확한 시범 예시가 필요한 정도를 얼마나 줄여주는가?
  • RQ5언어 템플릿과 브리징 오브젝트가 소수 샘플 설정에서 추론 효율성에 어떻게 함께 영향을 미치는가?

주요 결과

  • 산술 추론과 다단계 QA 양쪽 작업에서, 완전히 잘못된 추론 단계를 포함한 시범 예시조차도 표준 CoT의 80-90% 성능을 달성한다.
  • 논리적 타당성이 없는 조건에서도 모델은 질문과 관련 있고 논리적 흐름을 유지하는 일관된 단계별 추론을 생성한다.
  • 질문에 대한 추론 단계의 관련성과 단계의 정확한 순서가 논리적 타당성보다 성능 향상에 더 중요한 요소이다.
  • CoT 프롬프팅 하에서 모델의 효과적 추론 능력은 주로 사전 훈련된 추론 능력에 기반하며, 시범 예시의 주요 기능은 출력 형식과 구조를 정규화하는 데 있다.
  • 언어 템플릿과 브리징 오브젝트는 필수적인 구성 요소이지만, 그 정확성보다는 존재 여부와 질문에 대한 적절한 정렬이 더 중요하다.
  • 결과적으로 CoT 프롬프팅은 올바른 추론을 가르치는 메커니즘이나, 형식 정규화 기법으로서의 기능을 더 잘 수행하며, 문맥 학습에 대한 기존의 가정을 도전한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.