Skip to main content
QUICK REVIEW

[논문 리뷰] Contrastive Chain-of-Thought Prompting

Yew Ken Chia, Guizhen Chen|arXiv (Cornell University)|2023. 11. 15.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대조적 사고 체인(Chain-of-Thought, CoT) 프롬프팅을 제안하며, 이는 유효한 사고 체인과 유효하지 않은 사고 체인을 모두 제공함으로써 대규모 언어 모델의 추론 능력을 향상시키는 방법이다. 기존의 정확한 사고 체인에서 자동으로 대조적 추론 과정을 생성함으로써 추론 정확도를 향상시키고 오류를 줄이며, GPT-3.5-Turbo를 사용할 때 GSM-8K 및 Bamboogle Press 벤치마크에서 각각 9.8점과 16.0점의 절대적 성능 향상을 달성한다.

ABSTRACT

Despite the success of chain of thought in enhancing language model reasoning, the underlying process remains less well understood. Although logically sound reasoning appears inherently crucial for chain of thought, prior studies surprisingly reveal minimal impact when using invalid demonstrations instead. Furthermore, the conventional chain of thought does not inform language models on what mistakes to avoid, which potentially leads to more errors. Hence, inspired by how humans can learn from both positive and negative examples, we propose contrastive chain of thought to enhance language model reasoning. Compared to the conventional chain of thought, our approach provides both valid and invalid reasoning demonstrations, to guide the model to reason step-by-step while reducing reasoning mistakes. To improve generalization, we introduce an automatic method to construct contrastive demonstrations. Our experiments on reasoning benchmarks demonstrate that contrastive chain of thought can serve as a general enhancement of chain-of-thought prompting.

연구 동기 및 목표

  • 유효하지 않은 사고 체인 프롬프팅이 언어 모델의 추론 능력을 향상시킬 수 있는지 조사하는 것. 이는 이전 연구에서 유효한 사고 체인만 유익하다는 가정에 도전하기 위함이다.
  • 사고 체인 프롬프팅이 실제로 어떻게 작동하는지에 대한 이해 부족을 해결하는 것. 특히 유효하지 않은 사고 체인이 유효한 사고 체인과 유사한 성능을 보일 때가 많기 때문이다.
  • 모델이 무엇을 하면 안 되는지 명시적으로 가르침으로써 추론 오류를 줄이고, 더 견고하고 신뢰할 수 있는 모델을 만드는 것.
  • 추가적인 애너테이션 비용 없이 대조적 프롬프팅을 자동으로 생성하는 방법을 개발함으로써 다양한 작업으로의 일반화를 가능하게 하는 것.
  • 기존의 사고 체인 프롬프팅을 보완하는 일반적인 방법으로서 대조적 CoT를 위치지우며, 기존의 디코딩 전략(예: 자기 일관성)과 호환되도록 하는 것.

제안 방법

  • 이 방법은 흐름 프롬프트 컨텍스트에 정확한 사고 체인과 잘못된 사고 체인을 모두 제공하는 대조적 사고 체인 프롬프팅을 도입한다.
  • 논리적 또는 사실적인 모순을 통해 기존의 유효한 추론 과정을 변형함으로써 유효하지 않은 사고 체인을 자동으로 생성한다. 예를 들어 잘못된 산술 계산이나 잘못된 추론 단계를 포함한다.
  • 변형 전략은 작업의 관련성을 유지하면서도 현실적으로 보이지만 잘못된 추론 경로를 도입함으로써 모델이 반례로부터 배울 수 있도록 설계되어 있다.
  • 이 방법은 작업에 종속되지 않으며, 자기 일관성과 같은 기존의 CoT 디코딩 전략과 호환되며, 성능 향상을 더욱 증폭시킨다.
  • 대조적 학습과 유사하게 모델이 정확한 추론 경로와 잘못된 추론 경로를 구분할 수 있도록 능력을 활용함으로써 추론 일반화 능력을 향상시킨다.
  • 대조적 프롬프팅의 구성에는 새로운 애너테이션 필요 없이 기존의 정확한 추론 과정에서 파생되기 때문에 비용이 최소화된다.
Figure 1: Example of contrastive chain-of-thought which leverages both positive and negative demonstrations to enhance language model reasoning.
Figure 1: Example of contrastive chain-of-thought which leverages both positive and negative demonstrations to enhance language model reasoning.

실험 결과

연구 질문

  • RQ1기존 연구에서 유효하지 않은 사고 체인이 거의 영향을 주지 않는다는 결과가 있었음에도 불구하고, 유효하지 않은 사고 체인 프롬프팅이 언어 모델의 추론 성능을 향상시킬 수 있는가?
  • RQ2대조적 프롬프팅에서 부정적 예시로 포함할 때 가장 효과적인 추론 오류 유형은 무엇인가?
  • RQ3기존의 정확한 추론 과정에서 수동 애너테이션 없이 대조적 프롬프팅을 자동으로 생성할 수 있는가?
  • RQ4대조적 CoT는 다양한 추론 작업으로 일반화되며 일반적인 추론 오류에 대한 견고성을 향상시키는가?
  • RQ5대조적 CoT는 기존의 디코딩 전략(예: 자기 일관성)과 어떻게 상호작용하며, 그 기존 전략의 이점을 증폭시키는가?

주요 결과

  • GPT-3.5-Turbo를 사용할 때 대조적 사고 체인은 GSM-8K 벤치마크에서 9.8점의 절대적 성능 향상을, Bamboogle Press 벤치마크에서 16.0점의 절대적 성능 향상을 달성한다.
  • 수동 분석을 통해 모델 출력을 검토한 결과, 생성된 사고 체인의 추론 오류 수가 크게 감소한 것으로 확인되었다.
  • 자기 일관성과 조합했을 때, 대조적 CoT는 AQuA 데이터셋에서 추가로 14.2%의 성능 향상을 기록하여 상호보완적인 이점을 입증했다.
  • 대조적 프롬프팅의 자동 생성은 기존 CoT와 동일한 애너테이션 비용을 유지하므로 확장 가능하고 실용적이다.
  • 다양한 추론 벤치마크에서 기존 CoT를 초월하는 성능을 기록함으로써, 이 방법이 일반적인 성능 향상 수단으로서의 효과를 입증했다.
  • 결과는 긍정적 예와 부정적 예를 모두 배우는 것이 추론의 견고성과 모델의 신뢰성 향상에 필수적임을 시사한다.
Figure 2: Categorization of invalid chain-of-thought examples, following Wang et al. ( 2023 ) .
Figure 2: Categorization of invalid chain-of-thought examples, following Wang et al. ( 2023 ) .

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.