Skip to main content
QUICK REVIEW

[논문 리뷰] RCOT: Detecting and Rectifying Factual Inconsistency in Reasoning by Reversing Chain-of-Thought

Tianci Xue, Ziqi Wang|arXiv (Cornell University)|2023. 05. 19.
Topic Modeling인용 수 5
한 줄 요약

RCOT (역방향 사고 체인)는 원본 문제와 비교하여 해결책에서 문제를 재구성함으로써 LLM이 생성한 추론 내 사실적 오류를 탐지하고 수정하는 새로운 방법이다. 미세한 피드백을 통해 환각, 무시, 오해를 수정하며, 일곱 개인 산술 추론 데이터셋에서 최신 기술 수준의 성능을 달성한다. 인간이 작성한 피드백을 사용할 경우 ChatGPT는 GSM8K에서 94.6%의 정확도를 기록한다.

ABSTRACT

Large language Models (LLMs) have achieved promising performance on arithmetic reasoning tasks by incorporating step-by-step chain-of-thought (CoT) prompting. However, LLMs face challenges in maintaining factual consistency during reasoning, exhibiting tendencies to condition overlooking, question misinterpretation, and condition hallucination over given problems. Existing methods use coarse-grained feedback (e.g., whether the answer is correct) to improve factual consistency. In this work, we propose RCoT (Reversing Chain-of-Thought), a novel method to improve LLMs' reasoning abilities by automatically detecting and rectifying factual inconsistency in LLMs, generated solutions. To detect factual inconsistency, RCoT first asks LLMs to reconstruct the problem based on generated solutions. Then fine-grained comparisons between the original problem and the reconstructed problem expose the factual inconsistency in the original solutions. To rectify the solution, RCoT formulates detected factual inconsistency into fine-grained feedback to guide LLMs in revising solutions. Experimental results demonstrate improvements of RCoT over standard CoT, Self-Consistency and Self-Refine across seven arithmetic datasets. Moreover, we find that manually written fine-grained feedback can dramatically improve LLMs' reasoning abilities (e.g., ChatGPT reaches 94.6% accuracy on GSM8K), encouraging the community to further explore the fine-grained feedback generation methods.

연구 동기 및 목표

  • LLM 추론에서 조건 환각, 무시, 질문 오해와 같은 지속적인 사실 오류 문제를 해결하기 위해.
  • 粗보정 피드백을 넘어서, 미세한 정밀도로 오류를 탐지할 수 있는 방법을 개발하기 위해.
  • 실제로 수정할 수 있고 해석이 가능한 피드백을 생성하여 LLM이 해결책을 효과적으로 수정할 수 있도록 돕기 위해.
  • 미세한 피드백이 강력한 프롬프팅과 결합될 경우 추론 정확도를 크게 향상시킬 수 있음을 입증하기 위해.
  • 사고 체인 추론에서 사실 오류를 자동으로 탐지하고 수정할 수 있는 프레임워크를 구축하기 위해.

제안 방법

  • RCOT은 역방향 프롬프팅 전략을 사용하여 LLM이 생성한 해결책에서 문제를 재구성한다.
  • 재구성된 문제와 원래 문제 사이의 미세한 비교를 수행하여 사실 오류를 탐지한다.
  • 탐지된 오류는 구체적인 오류(예: 환각된 조건, 간과된 제약 조건)를 강조하는 정확하고 자연어 형태의 피드백으로 제작된다.
  • 이 피드백은 LLM이 원래 해결책을 단계별로 수정하도록 이끈다.
  • 이 방법은 반복적으로 적용되어 피드백과 수정을 반복함으로써 자기 수정이 가능해진다.
  • RCOT은 GPT-3.5 및 ChatGPT와 같은 LLM을 사용하여 일곱 개인 산술 추론 데이터셋에서 평가된다.

실험 결과

연구 질문

  • RQ1역방향 문제 재구성이 LLM이 생성한 추론 내 사실 오류를 효과적으로 탐지할 수 있는가?
  • RQ2오류 탐지에서 유도된 미세한 피드백이 거시적 피드백보다 추론 정확도를 더 높일 수 있는가?
  • RQ3RCOT은 표준 CoT, Self-Consistency, Self-Refine와 비교해 사실 일관성과 정확도 측면에서 어떻게 다른가?
  • RQ4수동으로 작성된 미세한 피드백이 LLM 추론 성능을 얼마나 향상시킬 수 있는가?
  • RQ5RCOT은 조건 환각 및 질문 오해와 같은 복잡한 추론 오류를 탐지하고 수정할 수 있는가?

주요 결과

  • RCOT은 일곱 개인 산술 추론 데이터셋에서 표준 CoT, Self-Consistency, Self-Refine보다 뚜렷이 뛰어난 성능을 보이며, 뛰어난 사실 일관성을 입증한다.
  • GSM8K 데이터셋에서 수동으로 작성된 미세한 피드백을 사용할 경우, ChatGPT는 94.6%의 정확도를 기록하여 고품질 피드백의 잠재력을 입증한다.
  • 비교 사례 연구에서 Double-Check가 수정하지 못한 해결책을 RCOT이 성공적으로 수정했다. 이는 그룹 크기와 관련된 잘못된 가정 같은 특정 사실 오류를 탐지할 수 있었기 때문이다.
  • 이 방법은 환각된 조건(예: 상자 무게를 16 lbs로 잘못 가정한 경우)과 간과된 제약 조건(예: 일정 문제에서 '2일 후'를 누락한 경우)을 식별하고 수정했다.
  • RCOT의 피드백은 이해 가능하고 실행 가능하여 LLM과 인간이 추론 오류를 추적하고 이해하는 데 도움이 된다.
  • 비록 효과적이지만, RCOT은 계산 오류를 탐지하지 못하며, 여러 번의 LLM 추론 단계가 필요하여 추론 속도에 영향을 줄 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.