Skip to main content
QUICK REVIEW

[논문 리뷰] Reasoning with Language Model Prompting: A Survey

Shuofei Qiao, Yixin Ou|arXiv (Cornell University)|2022. 12. 19.
Topic Modeling인용 수 12
한 줄 요약

이 종합 검토는 대규모 언어 모델 프롬프팅을 통한 추론에 대한 포괄적인 개요를 제공하며, 방법을 전략 강화형, 프로세스 최적화형, 지식 강화형 접근으로 분류한다. 체인 오브 씽크(Chain-of-Thought) 및 자기 일관성 프롬프팅 같은 기법들이 산술, 일반 지식, 기호 추론 작업에서 성능을 크게 향상시키며, 최신 기술 모델들이 GSM8K 및 CommonsenseQA와 같은 벤치마크에서 인간 수준에 가까운 성능을 달성하고 있음을 보여준다.

ABSTRACT

Reasoning, as an essential ability for complex problem-solving, can provide back-end support for various real-world applications, such as medical diagnosis, negotiation, etc. This paper provides a comprehensive survey of cutting-edge research on reasoning with language model prompting. We introduce research works with comparisons and summaries and provide systematic resources to help beginners. We also discuss the potential reasons for emerging such reasoning abilities and highlight future research directions. Resources are available at https://github.com/zjunlp/Prompt4ReasoningPapers (updated periodically).

연구 동기 및 목표

  • 최근 언어 모델 프롬프팅을 통한 추론 분야의 발전을 체계적으로 정리하고 분석하는 것.
  • 대규모 언어 모델의 추론 능력을 향상시키는 데 기여하는 핵심 프롬프팅 전략을 식별하고 분류하는 것.
  • 전략 강화형, 프로세스 최적화형, 지식 강화형 접근 방식을 포함한 추론 방법의 체계적 분류 체계를 제공하는 것.
  • 언어 모델 추론 분야의 열린 과제와 향후 연구 방향을 부각하는 것.
  • 연구자들과 초보자들이 활용할 수 있도록 정제된 자원과 벤치마크를 제공하는 것.

제안 방법

  • 추론 프롬프팅 방법을 전략 강화형, 프로세스 최적화형, 지식 강화형으로 나누는 분류 체계를 제안한다.
  • 전략 강화형 방법을 단일 단계(예: 체인 오브 씽크, 제로샷 CoT) 및 다단계(예: 라스트 투 모스트, 세프 어시크) 프롬프팅 전략으로 분류한다.
  • 자기 최적화(예: 캘리브레이터, 인간-AI 피드백), 앙상블 최적화(예: 자기 일관성, 다양한 샘플링), 반복 최적화(예: Reflexion, 세프 라이너) 등의 프로세스 최적화 기법을 소개한다.
  • 외부 엔진 통합을 다루며, 코드 인터프리터(예: PAL, COCOGEN) 및 물리적 시뮬레이터(예: 마인드즈 아이)를 통해 외부 도구를 통한 추론 능력 향상을 분석한다.
  • 암시적(예: 생성된 지식, 미세조정된 CoT) 및 명시적(예: 논리 솔버, 보팅-k) 지식 주입 방식을 통한 지식 강화형 추론을 고찰한다.
  • GSM8K, CommonsenseQA, MATH 등의 벤치마크 데이터셋을 활용해 다양한 방법 간의 추론 성능을 평가하고 비교한다.

실험 결과

연구 질문

  • RQ1대규모 언어 모델이 복잡한 추론을 수행할 수 있도록 하는 핵심 프롬프팅 전략는 무엇인가?
  • RQ2체인 오브 씽크, 자기 일관성, 도구 보강형 프롬프팅과 같은 다양한 프롬프팅 기법들이 추론 작업 전반에서 성능에 어떻게 영향을 미치는가?
  • RQ3외부 지식 또는 도구(예: 코드 인터프리터, 시뮬레이터)는 추론 능력을 어떻게 향상시키는가?
  • RQ4어떤 프롬프팅 기법이 산술, 일반 지식, 기호 추론과 같은 다양한 추론 작업 간에서 더 잘 일반화되는가?
  • RQ5현재의 프롬프팅을 통한 추론 접근 방식의 한계와 열린 과제는 무엇이며, 향후 연구는 어디에 집중해야 하는가?

주요 결과

  • 체인 오브 씽크 프롬프팅은 GSM8K와 같은 산술 작업에서 성능을 크게 향상시키며, 소수의 예시가 제공된 설정에서도 모델이 80% 이상의 정확도를 달성한다.
  • 자기 일관성 및 반복 보완 기법(예: 세프 라이너, Reflexion)은 다수의 추론 경로를 집계하거나 보완함으로써 추론의 신뢰성을 향상시킨다.
  • 코드 인터프리터 기반 프롬프팅(예: PAL, COCOGEN)은 실행 가능한 코드를 생성하고 실행함으로써 기호적 및 수학적 추론의 정확도를 높인다.
  • ChatGPT는 GSM8K 및 CommonsenseQA에서 제로샷 추론 능력이 뛰어나, 맥락 예시 없이도 단계별 설명과 정확한 답변을 생성한다.
  • 마지막 글자 연결(Last Letter Concatenation)과 같은 기호 추론 작업에서는 ChatGPT의 성능이 떨어지며, 이는 추론 능력이 모든 추론 유형에 균일하게 분포되어 있지 않음을 시사한다.
  • 이 검토는 특히 생성된 지식 또는 명시적 지식 주입을 통한 지식 강화형 프롬프팅이 일반 지식 및 논리적 추론 벤치마크에서 추론 능력을 향상시킨다는 점을 규명한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.