[논문 리뷰] Reprompting: Automated Chain-of-Thought Prompt Inference Through Gibbs Sampling
Reprompting는 인간 간섭 없이 소수의 추론 작업을 위한 고성능 Chain-of-Thought (CoT) 프롬프트를 자동으로 반복적으로 탐색하는 알고리즘이다. 더 강력한 모델을 사용해 초기 CoT 해답을 생성하고, 이를 바탕으로 자기 자신을 재프롬프팅하여 점차 개선함으로써, Big-Bench Hard 작업에서 인간이 작성한 CoT 기준보다 최대 +17.0 정확도 포인트 향상을 달성한다.
We introduce Reprompting, an iterative sampling algorithm that automatically learns the Chain-of-Thought (CoT) recipes for a given task without human intervention. Through Gibbs sampling, Reprompting infers the CoT recipes that work consistently well for a set of training samples by iteratively sampling new recipes using previously sampled recipes as parent prompts to solve other training problems. We conduct extensive experiments on 20 challenging reasoning tasks. Results show that Reprompting outperforms human-written CoT prompts substantially by +9.4 points on average. It also achieves consistently better performance than the state-of-the-art prompt optimization and decoding algorithms.
연구 동기 및 목표
- 인간이 작성한 Chain-of-Thought (CoT) 프롬프트의 확장성과 일반화 능력에 한계가 있다는 점을 해결하기 위해, 전문가의 노력이 필요하고 모델에 특화된 프롬프트라는 점을 고려한다.
- 소수의 레이블이 부여된 질문-답안 쌍만을 사용하여 주어진 모델에 대해 효과적인 CoT 프롬프트를 자동으로 발견하는 방법을 개발한다.
- 특정 타겟 모델에 최적화된 CoT 프롬프트를 통해 강력한 모델에서 약한 모델로 지식을 전이할 수 있도록 한다.
- 일괄적인 프롬프트가 아닌 모델에 맞는 CoT 조리법을 식별함으로써 공정한 모델 비교를 가능하게 한다.
- Gibbs 샘플링을 사용해 반복적이고 자기 개선형 프롬프트 생성을 통해 소수의 추론 성능을 향상시킨다.
제안 방법
- Reprompting는 추론 레시피의 공동 분포로 CoT 프롬프트 탐색을 설정하며, 이는 직접 계산하기 어려운 문제이다.
- 이 알고리즘은 이전에 생성된 해답을 부모 프롬프트로 사용해 다른 학습 예제를 해결함으로써, 반복적으로 새로운 CoT 레시피를 샘플링하는 Gibbs 샘플링을 사용한다.
- 초기 레시피는 제로샷 프롬프팅을 통해 생성되며, 다양한 학습 예제를 사용해 여러 라운드의 자기 재프롬프팅을 통해 개선된다.
- 다양한 학습 문제에서 유도된 해답을 통합해 공통의 고성능 프롬프트 세트를 구성함으로써, 테스트 인스턴스로의 일반화를 가능하게 한다.
- 더 강력한 LLM(예: ChatGPT)이 초기 CoT 해답을 생성하고, 더 약한 LLM(예: InstructGPT)이 이를 개선함으로써 모델 조합을 지원한다.
- 이 과정는 학습 문제를 일관되게 해결하고, 새로운 테스트 예제로도 일반화되는 안정적인 CoT 레시피 집합으로 수렴한다.
실험 결과
연구 질문
- RQ1다단계 추론 작업에 대해 인간 간섭 없이 자동으로 효과적인 Chain-of-Thought 프롬프트를 탐색할 수 있는가?
- RQ2Gibbs 샘플링을 통한 반복적 자기 재프롬프팅은 제로샷 또는 인간이 작성한 프롬프트에 비해 CoT 프롬프트 품질을 어떻게 향상시키는가?
- RQ3약한 LLM은 강력한 LLM이 생성한 CoT 프롬프트를 Reprompting을 통해 얼마나 크게 향상시킬 수 있는가?
- RQ4CoT 프롬프트 성능이 타겟 LLM에 크게 의존하는가? 이는 모델에 특화된 최적화가 필요한가?
- RQ5Reprompting은 벤치마크 추론 작업에서 최신 기술인 인간이 작성한 CoT 프롬프트를 뛰어넘을 수 있는가?
주요 결과
- Reprompting는 Big-Bench Hard 작업에서 이전 최고 기술에 비해 최대 +17.0 정확도 포인트 향상을 달성했다.
- 다섯 개의 BBH 작업에서 Reprompting는 ChatGPT와 InstructGPT 모두에서 제로샷, 소수의 추론, 인간이 작성한 CoT 기준보다 일관되게 뛰어난 성능을 보였다.
- ChatGPT를 사용해 초기 CoT 해답을 생성한 후 InstructGPT로 재프롬프팅하면, InstructGPT 단독 사용 대비 최대 +71.0 성능 향상을 기록했다.
- InstructGPT는 특정 작업에서 CoT 프롬프트가 자신에게 특화되어 최적화된 경우, ChatGPT를 초월하는 성능을 보였다. 이는 모델에 특화된 프롬프트 민감도를 시사한다.
- 한 모델에서 효과적인 CoT 레시피가 다른 모델에선 실패할 수 있음을 입증하며, 모델에 특화된 프롬프트 최적화의 필요성을 강조한다.
- Reprompting는 소수의 학습 예제에서만 이루어져도 고성능 CoT 레시피를 성공적으로 생성했으며, 추론 속도 저하 없이 강력한 소수의 추론 일반화를 가능하게 했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.