Skip to main content
QUICK REVIEW

[논문 리뷰] Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks

Wenhu Chen, Xueguang Ma|arXiv (Cornell University)|2022. 11. 22.
Topic Modeling인용 수 110
한 줄 요약

PoT 프롬프트는 LLM이 외부에서 실행되는 Python 유사 프로그램을 생성하도록 하여 계산을 추론으로부터 분리하고, 수치 추론 벤치마크에서 Chain-of-Thought보다 상당한 이점을 얻습니다.

ABSTRACT

Recently, there has been significant progress in teaching language models to perform step-by-step reasoning to solve complex numerical reasoning tasks. Chain-of-thoughts prompting (CoT) is by far the state-of-art method for these tasks. CoT uses language models to perform both reasoning and computation in the multi-step `thought' process. To disentangle computation from reasoning, we propose `Program of Thoughts' (PoT), which uses language models (mainly Codex) to express the reasoning process as a program. The computation is relegated to an external computer, which executes the generated programs to derive the answer. We evaluate PoT on five math word problem datasets (GSM, AQuA, SVAMP, TabMWP, MultiArith) and three financial-QA datasets (FinQA, ConvFinQA, TATQA) for both few-shot and zero-shot setups. Under both few-shot and zero-shot settings, PoT can show an average performance gain over CoT by around 12\% across all the evaluated datasets. By combining PoT with self-consistency decoding, we can achieve SoTA performance on all math problem datasets and near-SoTA performance on financial datasets. All of our data and code are released in Github https://github.com/wenhuchen/Program-of-Thoughts

연구 동기 및 목표

  • 수치 추론 과제에서 계산과 추론을 분리해야 할 필요성을 제기한다.
  • 계산을 외부 해석기로 위임하는 PoT(Program of Thoughts)를 제안하고, 추론은 코드로 수행한다.
  • 수학 단어 문제와 금융 QA 데이터 세트의 폭넓은 집합에서 PoT를 평가하여 CoT 프롬프팅 대비 이득을 평가한다.
  • 제로샷 및 few-shot PoT와 자체 일관성 디코딩을 조사하고, 구성요소를 이해하기 위해 제거 실험을 수행한다.

제안 방법

  • 생각 과정이 자연어 합리화가 아니라 Python 코드로 표현되는 PoT를 도입한다.
  • 생성된 프로그램을 실행하고 정답을 얻기 위해 외부 Python 인터프리터(SymPy)를 사용한다.
  • LLMs(주로 Codex)를 few-shot 예시나 zero-shot 모드로 프롬프트하여 프로그램을 생성하게 한다.
  • 강건성을 높이기 위해 PoT+SC(자체 일관성 디코딩)로 PoT를 선택적으로 결합한다.
  • 제로샷 PoT에서는 해시 접두사 주석을 억제하여 코드 주석에서의 추론을 억제한다.
  • 이질적 입력(text, tables, conversations)을 LLM 프롬프트로 선형화한다.
  • 수학 단어 문제와 금융 QA에 걸친 아홉 데이터셋(GSM8K, AQuA, SVAMP, TabMWP, MultiArith, FinQA, ConvFinQA, TATQA)을 대상으로 평가한다.

실험 결과

연구 질문

  • RQ1다양한 데이터셋에서 PoT가 Chain-of-Thought(CoT) 프롬프팅보다 수치 추론 정확도를 향상시키는가?
  • RQ2few-shot 대 zero-shot PoT의 효과는 무엇이며, 자체 일관성 디코딩이 PoT와 어떻게 상호 작용하는가?
  • RQ3백엔드 모델 및 프롬프트 설계가 PoT 성능과 안정성에 어떻게 영향을 미치는가?
  • RQ4의미적 바인딩과 다단계 추론이 직접 방정식 생성과 비교하여 PoT에 미치는 영향은?
  • RQ5다단계 추론 과제에 PoT를 CoT와 효과적으로 통합할 수 있는가?

주요 결과

  • PoT는 평가된 데이터셋에서 제로샷 및 few-shot 설정에서 CoT에 비해 평균 약 12%의 이득을 제공합니다.
  • PoT+SC( PoT with self-consistency)는 수학 데이터셋에서 최첨단과 유사한 결과를 달성하고 금융 데이터셋에서 최상의 결과에 근접합니다(GPT-4 제외).
  • 제로샷 PoT는 수학 데이터셋에서 제로샷 CoT보다 평균 12% 더 우수하며, TabMWP에서 few-shot CoT를 능가할 수 있습니다.
  • PoT는 여러 벤치마크에서 PaL보다 두드러진 차이로 우수합니다(예: SVAMP, ASDIV).
  • 의미적 바인딩과 다단계 추론은 PoT의 이점을 좌우하는데 필수적이며, 바인딩 제거나 직접 방정식 생성을 시도하면 특히 복잡한 문제에서 성능이 저하됩니다.
  • 오류 분석은 값의 근거화 오류가 실패의 상당 부분을 차지하고, 논리 생성 오류도 존재함을 보여주며, PoT는 일반적으로 정확한 인터프리터에 위임함으로써 산술 계산 오류를 줄입니다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.