Skip to main content
QUICK REVIEW

[논문 리뷰] LLMs cannot find reasoning errors, but can correct them given the error location

Gladys Tyen, Hassan Mansoor|arXiv (Cornell University)|2023. 11. 14.
Software Engineering Research인용 수 6
한 줄 요약

이 논문은 Chain-of-Thought 추론 흐름에서 발생하는 논리적 오류를 담은 BIG-Bench Mistake 데이터셋을 소개하고, 오류 위치를 활용해 오류를 수정하는 경량 보정 방법인 백트래킹을 제안한다. 대규모 언어 모델(Large Language Models, LLMs)은 독립적으로 오류를 탐지하지 못하지만, 백트래킹은 오류 위치가 제공될 경우 보다 높은 정확도 향상을 이룬다 (보류된 작업에서 최대 +22.59% 향상). 이는 보상 모델의 정확도가 60–70%일지라도 성립하며, 오류 보정이 오류 위치가 제공될 경우 가능하다는 것을 보여준다.

ABSTRACT

While self-correction has shown promise in improving LLM outputs in terms of style and quality (e.g. Chen et al., 2023b; Madaan et al., 2023), recent attempts to self-correct logical or reasoning errors often cause correct answers to become incorrect, resulting in worse performances overall (Huang et al., 2023). In this paper, we show that poor self-correction performance stems from LLMs' inability to find logical mistakes, rather than their ability to correct a known mistake. Firstly, we benchmark several state-of-the-art LLMs on their mistake-finding ability and demonstrate that they generally struggle with the task, even in highly objective, unambiguous cases. Secondly, we test the correction abilities of LLMs -- separately from mistake finding -- using a backtracking setup that feeds ground truth mistake location information to the model. We show that this boosts downstream task performance across our 5 reasoning tasks, indicating that LLMs' correction abilities are robust. Finally, we show that it is possible to obtain mistake location information without ground truth labels or in-domain training data. We train a small classifier with out-of-domain data, which exhibits stronger mistake-finding performance than prompting a large model. We release our dataset of LLM-generated logical mistakes, BIG-Bench Mistake, to enable further research into locating LLM reasoning mistakes.

연구 동기 및 목표

  • LLMs가 자신의 Chain-of-Thought 추론 흐름에서 논리적 오류를 신뢰성 있게 탐지할 수 있는지 조사한다.
  • LLMs가 추론 오류를 수정할 때 자가보정이 실패하는 문제를 다스리며, 이는 성능 저하를 유발할 수 있다.
  • 오류 위치가 제공될 경우 출력 보정을 향상시키는 백트래킹 방법을 제안한다.
  • 골드 스탠다드 오류 레이블과 시뮬레이션된 보상 모델을 사용해 백트래킹의 효과성을 평가한다.
  • 작은 피넷유팅된 보상 모델이 오류 탐지에 도움을 줄 수 있고, 분포 외 작업으로 일반화되는지 탐색한다.

제안 방법

  • 저자들은 PaLM 2-L-Unicorn이 생성한 CoT 스타일 추론 흐름 2,186건을 포함한 BIG-Bench Mistake 데이터셋을 공개하며, 첫 번째 논리적 오류 위치를 주석 처리했다.
  • 자기보정을 두 가지 구성 요소로 분해한다: 오류 탐지(오류 식별)와 출력 보정(오류 수정), 핵심 실패 요인을 오류 탐지로 규명한다.
  • 백트래킹을 후행 보정 기법으로 제안하며, 모델의 자체 추론 경로를 재사용하고 오류 위치 이후의 단계만 수정한다.
  • 백트래킹은 가중치 업데이트 없이도 반복적인 향상을 가능하게 하는 '말하기 기반 강화학습'의 한 형태로 프레임워크화한다.
  • 네 가지 작업에서 작은 PaLM 2-XS-Otter 보상 모델을 훈련하고, 보류된 작업에서 오류 탐지 정확도 향상 능력을 평가한다.
  • 골드 스탠다드 오류 레이블과 다양한 정확도 수준(예: 60–70%)의 시뮬레이션된 보상 모델을 사용해 백트래킹 성능을 평가한다.
Figure 1: Graph of mistake location accuracies for each prompting method (excluding GPT-4-Turbo which we do not have CoT step-level results for). Blue bars show accuracies on traces with no mistakes, so the model must predict that the trace has no mistake to be considered correct; orange bars show a
Figure 1: Graph of mistake location accuracies for each prompting method (excluding GPT-4-Turbo which we do not have CoT step-level results for). Blue bars show accuracies on traces with no mistakes, so the model must predict that the trace has no mistake to be considered correct; orange bars show a

실험 결과

연구 질문

  • RQ1최신 LLMs는 외부 피드백 없이도 자신의 Chain-of-Thought 추론 흐름에서 논리적 오류를 안정적으로 탐지할 수 있는가?
  • RQ2추론 오류의 위치가 제공될 경우 LLM의 출력 수정 능력이 크게 향상되는가?
  • RQ3작은 피넷유팅된 보상 모델이 제로샷 LLM보다 오류 탐지 작업에서 뛰어난 성능을 보일 수 있고, 분포 외 작업으로 일반화되는가?
  • RQ4골드 표준이 아닌 저정확도 보상 모델이 오류 위치를 제공할 경우 백트래킹의 효과는 어떠한가?
  • RQ5백트래킹을 반복적으로 적용해 하나의 추론 흐름에서 다수의 오류를 수정할 수 있는가?

주요 결과

  • PaLM 2-L-Unicorn과 같은 최신 LLMs는 오류 탐지에 있어 심각한 어려움을 겪으며, 객관적이고 명확한 논리적 오류에서도 낮은 정확도를 기록한다.
  • 골드 스탠다드 오류 위치를 사용한 백트래킹은 원래 작업의 성능을 향상시키며, Dyck 언어 작업에서 최대 +22.59%의 향상을 기록한다.
  • 보상 모델의 정확도가 60–70%일지라도 백트래킹은 효과가 유지되며, 이는 정확도 차이가 낮은 모델보다 더 큰 향상 폭을 기록한다.
  • 피넷유팅된 작은 보상 모델은 보류된 다섯 개 작업 중 네 개에서 제로샷 기준 대비 절대 정확도 향상 +11.66에서 +22.59를 달성한다.
  • 보상 모델은 분포 외 작업으로의 일반화 가능성을 보이며, 이는 일반화 잠재력이 있음을 시사하지만, 작업 간 성능 향상은 일관되지 않다.
  • 이 연구는 자가보정에서의 주요 장애 요인은 출력 보정이 아니라 오류 탐지임을 규명하며, 오류 위치가 제공될 경우 보정이 가능하다는 것을 입증한다.
Figure 2: $\Delta$ accuracy ${}_{\text{\char 51}}$ and $\Delta$ accuracy ${}_{\text{\char 55}}$ on each dataset as accuracy RM increases.
Figure 2: $\Delta$ accuracy ${}_{\text{\char 51}}$ and $\Delta$ accuracy ${}_{\text{\char 55}}$ on each dataset as accuracy RM increases.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.