Skip to main content
QUICK REVIEW

[논문 리뷰] Measuring reasoning capabilities of ChatGPT

Adrian Groza|arXiv (Cornell University)|2023. 10. 08.
Artificial Intelligence in EducationComputer Science인용 수 3
한 줄 요약

이 논문은 MALOGA 라이브러리에서 유래한 100개의 논리 퍼즐로 구성된 정제된 벤치마크를 사용하여 ChatGPT의 추론 능력을 평가한다. Prover9와 Mace4를 통한 형식적 검증을 통해 수행된다. 정답이면서 정당화된 응답은 전부 7%에 불과했으며, 평균적으로 각 해결책에 7개의 논리적 오류가 포함되어 있었고, 생성된 텍스트의 26.03%가 결함이 있다고 분류되어, 근거 없는 주장이나 일관성 없는 논리와 같은 체계적인 추론 오류가 드러났다.

ABSTRACT

I shall quantify the logical faults generated by ChatGPT when applied to reasoning tasks. For experiments, I use the 144 puzzles from the library \url{https://users.utcluj.ro/~agroza/puzzles/maloga}~\cite{groza:fol}. The library contains puzzles of various types, including arithmetic puzzles, logical equations, Sudoku-like puzzles, zebra-like puzzles, truth-telling puzzles, grid puzzles, strange numbers, or self-reference puzzles. The correct solutions for these puzzles were checked using the theorem prover Prover9~\cite{mccune2005release} and the finite models finder Mace4~\cite{mccune2003mace4} based on human-modelling in Equational First Order Logic. A first output of this study is the benchmark of 100 logical puzzles. For this dataset ChatGPT provided both correct answer and justification for 7\% only. %, while BARD for 5\%. Since the dataset seems challenging, the researchers are invited to test the dataset on more advanced or tuned models than ChatGPT3.5 with more crafted prompts. A second output is the classification of reasoning faults conveyed by ChatGPT. This classification forms a basis for a taxonomy of reasoning faults generated by large language models. I have identified 67 such logical faults, among which: inconsistencies, implication does not hold, unsupported claim, lack of commonsense, wrong justification. The 100 solutions generated by ChatGPT contain 698 logical faults. That is on average, 7 fallacies for each reasoning task. A third ouput is the annotated answers of the ChatGPT with the corresponding logical faults. Each wrong statement within the ChatGPT answer was manually annotated, aiming to quantify the amount of faulty text generated by the language model. On average, 26.03\% from the generated text was a logical fault.

연구 동기 및 목표

  • 다양한 형식 논리 퍼즐에 대한 ChatGPT의 추론 신뢰성 평가.
  • LLM 추론 평가를 위한 100개의 비도식적 논리 퍼즐로 구성된 벤치마크 데이터셋 구축.
  • LLM 생성 응답 내 논리 추론 오류의 분류 및 정량화.
  • 향후 모델 평가 및 향상에 활용할 수 있는 잘못된 추론의 주석 처리 예시 제공.

제안 방법

  • MALOGA 라이브러리에서 144개의 퍼즐을 선별하였으며, 도식적 입력을 포함한 퍼즐은 제외하여 100개의 퍼즐로 구성된 벤치마크를 확보함.
  • 등식 제1차 논리에서 정답 해결책을 형식적으로 검증하기 위해 Prover9와 Mace4를 사용함.
  • 표준 프롬프트를 사용하여 각 퍼즐을 ChatGPT-3.5에 제출하고 전체 응답을 수집함.
  • 근거 없는 주장이나 일관성 없는 함의와 같은 논리적 오류를 식별하고 분류하기 위해 수작업으로 각 응답을 주석 처리함.
  • 결함이 있는 텍스트 비율을 정량화하고, 각 해결책당 평균 논리적 오류 수를 계산함.
  • 반복적인 오류 패tern을 바탕으로 67종의 구체적인 추론 오류 유형을 정의한 분류 체계 개발.

실험 결과

연구 질문

  • RQ1ChatGPT는 다양한 형식 논리 퍼즐을 얼마나 정확하게 해결할 수 있는가?
  • RQ2LLM 생성 응답에서 흔히 나타나는 논리 추론 오류의 유형은 무엇인가?
  • RQ3LLM 추론 출력에서 논리적 모순과 근거 없는 주장은 얼마나 퍼진 편인가?
  • RQ4표준화된 논리 퍼즐 벤치마크를 사용하여 LLM의 추론 능력을 평가하고 비교할 수 있는가?

주요 결과

  • 100개 퍼즐 벤치마크에 대한 ChatGPT의 응답 중 정답이면서 완전히 정당화된 것은 전부 7%에 불과했다.
  • 평균적으로 각 해결책에 7개의 논리적 오류가 포함되어 있었으며, 전체 100개 응답에서 총 698개의 오류가 발생했다.
  • ChatGPT가 생성한 응답 텍스트 약 26.03%가 논리적 오류를 포함한다고 분류되었다.
  • 연구에서는 일관성 없는 주장, 근거 없는 주장, 잘못된 정당화 등 총 67종의 구체적인 추론 오류를 식별하였다.
  • 100개 퍼즐로 구성된 벤치마크 데이터셋은 공개되어 있으며, 단순한 산술 계산이나 패턴 매칭을 넘어서 LLM의 추론 능력을 시험할 수 있도록 설계되었다.
  • 논리적 오류의 분류 체계는 향후 LLM의 체계적 평가 및 개선을 위한 기초를 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.