Skip to main content
QUICK REVIEW

[논문 리뷰] Iteratively Prompt Pre-trained Language Models for Chain of Thought

Boshi Wang, Xiang Deng|arXiv (Cornell University)|2022. 03. 16.
Topic Modeling인용 수 6
한 줄 요약

이 논문은 사전 훈련된 언어 모델(PLM)이 단일 스텝이 아닌 다단계 추론을 수행할 수 있도록 동적으로 맥락에 맞는 프롬프트를 생성하는 반복적 프롬프팅 프레임워크를 제안한다. 이는 PLM의 미세조정 없이도 복잡한 추론 작업에서 성능을 향상시킨다. 이 방법은 다단계 추론 데이터셋 3종에서 기존의 프롬프팅 접근 방식보다 뛰어난 성능을 보이며, 단계별 지식 검색을 통해 '사고의 사슬'을 효과적으로 유도한다.

ABSTRACT

While Pre-trained Language Models (PLMs) internalize a great amount of world knowledge, they have been shown incapable of recalling these knowledge to solve tasks requiring complex & multi-step reasoning. Similar to how humans develop a "chain of thought" for these tasks, how can we equip PLMs with such abilities? In this work, we explore an iterative prompting framework, a new prompting paradigm which progressively elicits relevant knowledge from PLMs for multi-step inference. We identify key limitations of existing prompting methods, namely they are either restricted to queries with a single identifiable relation/predicate, or being agnostic to input contexts, which makes it difficult to capture variabilities across different inference steps. We propose an iterative context-aware prompter, which addresses these limitations by learning to dynamically synthesize prompts conditioned on the current step's contexts. Experiments on three datasets involving multi-step reasoning show the effectiveness of the iterative scheme and the context-aware prompter design.

연구 동기 및 목표

  • 기존의 프롬프팅 방법이 정적 또는 지나치게 단순한 프롬프트로 인해 사전 훈련된 언어 모델(PLM)의 다단계 추론을 효과적으로 이끌지 못하는 데에 기인한 한계를 해결하기 위해.
  • PLM이 복잡한 추론 작업을 위해 지식 사실의 시퀀스(즉, '사고의 사슬')를 회상할 수 있도록 경량이며, 미세조정이 없는 접근 방식을 개발하기 위해.
  • 현재 추론 단계와 이전에 확보한 증거를 바탕으로 동적으로 프롬프트를 합성하는 맥락 인식 프롬프터를 설계하여 추론의 정밀도를 향상시키기 위해.
  • 모델 파라미터의 무결성을 유지하면서도 추론 성능 향상에 기여하는 반복적 프롬프팅의 효과를 평가하기 위해.
  • 질적 및 양적 분석을 통해 학습된 프롬프팅 행동의 신뢰성과 강건성을 조사하기 위해.

제안 방법

  • 이 방법은 별도의 맥락 인식 프롬프터가 다단계 추론을 안내하기 위해 단계별로 특화된 프롬프트를 생성하는 반복적 프롬프팅 프레임워크를 도입한다.
  • 각 단계에서 프롬프터는 원본 쿼리와 지금까지 수집된 증거를 처리한 후, PLM이 다음 관련 사실을 회상하도록 이끄는 동적 프롬프트를 구성한다.
  • 프롬프터는 각 단계에서 쿼리의 해결되지 않은 구성 요소에 집중하면서 이전 지식을 통합하는 맥락 민감한 프롬프트를 생성하도록 훈련된다.
  • PLM는 훈련 전반에 걸쳐 동결되어 있어 파라미터 효율성을 확보하고 치명적인 잊힘을 방지한다.
  • 프롬프터는 현재 맥락을 조건으로 삼고 자연어 프롬프트를 생성하는 신경망으로 구현되어 있으며, 이는 영리하고 적응 가능한 프롬프팅을 가능하게 한다.
  • 최종 답변에 대한 손실이 계산되는 방식으로, 추론 체인에 대한 지도 학습을 통해 프레임워크를 종합적으로 최적화한다.

실험 결과

연구 질문

  • RQ1기존의 단일 스텝 프롬프팅과 비교해 복잡한 추론 작업에서 반복적 프롬프팅 프레임워크가 다단계 추론 능력을 향상시킬 수 있는가?
  • RQ2중간 추론 상태에 동적으로 적응하는 맥락 인식 프롬프터는 복잡한 추론 작업 성능에 어떤 영향을 미치는가?
  • RQ3반복적 구조는 추론 체인에서 환각 현상과 사실 일관성을 얼마나 줄이는가?
  • RQ4기존의 프롬프팅 베이스라인과 비교했을 때, 제안된 방법은 다단계 추론 벤치마크에서 정확도와 강건성 측면에서 어떻게 성능을 내는가?
  • RQ5학습된 프롬프팅 행동은 신뢰할 수 있고, 충실한 사고의 사슬로 간주될 수 있는가?

주요 결과

  • 반복적 프롬프팅 프레임워크는 2WikiMultiHopQA, R4C, 과학적 추론 데이터셋을 포함한 3종의 다단계 추론 데이터셋에서 표준 프롬프팅 및 기존 베이스라인보다 뚜렷한 성능 향상을 보였다.
  • 맥락 인식 프롬프터 설계는 정적 프롬프팅 방법에 비해 뚜렷한 성능 향상을 이끌어내어 단계별 및 맥락 민감한 프롬프트 생성의 중요성을 입증했다.
  • 양적 결과는 제안된 방법이 2WikiMultiHopQA 및 R4C에서 강력한 베이스라인 대비 정확도를 최대 15% 향상시켰음을 보여주었다.
  • 질적 분석을 통해 모델이 일관되고 충실한 추론 체인을 생성하는 것을 확인했으며, 각 단계에서 쿼리의 해결되지 않은 구성 요소에 적절히 초점을 맞춘 프롬프트를 생성했다.
  • PLM의 미세조정 없이도 높은 성능을 유지함으로써, 이 방법이 효율적이고 대규모 동결 모델과의 호환성도 높다는 점을 시사한다.
  • 제거 실험 결과, 반복적 구조와 맥락 인식 프롬프트 생성이 성능 향상에 필수적임을 확인했으며, 각 구성 요소가 최종 결과에 크게 기여했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.