Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating the Deductive Competence of Large Language Models

S. M. Seals, Valerie L. Shalin|arXiv (Cornell University)|2023. 09. 11.
Topic Modeling인용 수 4
한 줄 요약

이 연구는 대규모 언어 모델(Large Language Models, LLMs)의 연역적 추론 능력을 와이슨 선택 과제를 통해 평가하며, 내용 유형(사회적 규칙 대 비사회적 규칙)과 제시 방식이 성능에 미치는 영향을 테스트한다. 광범위한 텍스트 코퍼스로 훈련된 LLMs는 추상적 문제에서는 낮은 정확도(10-20%)를 보이며, 사회적 규칙 문제에 대해서도 다소 향상된 성능를 보이지만 인간 수준에 도달하지 못한다. 내용과 제시 방식 간의 예상치 못한 비인간적인 상호작용이 성능에 영향을 미치며, 인간 인지와는 다를 만한 잠재적 추론 편향이 존재함을 시사한다.

ABSTRACT

The development of highly fluent large language models (LLMs) has prompted increased interest in assessing their reasoning and problem-solving capabilities. We investigate whether several LLMs can solve a classic type of deductive reasoning problem from the cognitive science literature. The tested LLMs have limited abilities to solve these problems in their conventional form. We performed follow up experiments to investigate if changes to the presentation format and content improve model performance. We do find performance differences between conditions; however, they do not improve overall performance. Moreover, we find that performance interacts with presentation format and content in unexpected ways that differ from human performance. Overall, our results suggest that LLMs have unique reasoning biases that are only partially predicted from human reasoning performance and the human-generated language corpora that informs them.

연구 동기 및 목표

  • 인지과학에서 고전적으로 다뤄지는 연역적 추론 문제, 특히 와이슨 선택 과제를 LLMs가 해결할 수 있는지 평가하기 위해.
  • 인간과 마찬가지로 사회적 규칙 내용이 LLM 성능을 향상시킬 수 있는지 조사하기 위해.
  • 다양한 제시 방식이 LLM 추론 성능에 미치는 영향을 검토하기 위해.
  • 성능 차이가 다양한 LLM 아키텍처와 훈련 데이터를 통해 일관되게 나타나는지 확인하기 위해.
  • 인간 인지 패턴과 다름없는 잠재적 추론 편향을 식별하기 위해.

제안 방법

  • 표준화되고 통제된 문제 세트를 사용하여 다양한 내용(사회적, 현실적, 임의의)과 제시 방식(고전적, 뒤섞인, 재구성된)을 가진 LLMs에 와이슨 선택 과제를 제공하였다.
  • 고정된 문제 내용과 변형된 포맷을 사용하여 제시 방식이 모델 성능에 미치는 영향을 분리하여 분석하였다.
  • 논리적으로 타당한 카드 선택(모드 페온텐스 및 모드 톨렌스)에 초점을 맞춰 모델의 응답을 정확도 기준으로 측정하였다.
  • 다양한 아키텍처, 훈련 데이터, 목적을 가진 LLMs 간 성능을 비교하여 발견의 일관성을 평가하였다.
  • 전제 조건 카드 대 결과 조건 카드 선택 패턴을 분석하여 추론 편향을 탐지하였다.
  • 세부 조정 없이 제로샷 프롬프팅을 사용하여 일반적인 추론 능력을 평가하였다.
Figure 1: Breakdown of the different types of problems we examine.
Figure 1: Breakdown of the different types of problems we examine.

실험 결과

연구 질문

  • RQ1사회적 규칙 내용이 인간과 마찬가지로 LLM의 연역적 추론 성능을 향상시키는가?
  • RQ2다양한 제시 방식(예: 고전적 대비 뒤섞인)이 LLM의 Wason 과제 성능에 어떤 영향을 미치는가?
  • RQ3내용 유형과 제시 방식 간에 일관되게 나타나는 비인간적인 상호작용이 있는가?
  • RQ4LLMs가 조건부 추론 과제에서 인간의 추론 패턴을 어느 정도 재현하는가?
  • RQ5아키텍처와 훈련 차이가 있음에도 불구하고 LLM의 추론 편향은 일관되게 유지되는가?

주요 결과

  • LLMs는 추상적 Wason 문제에서 낮은 성능을 보이며, 정확도는 약 10-20%로 인간의 기준 수준과 일치한다.
  • 사회적 규칙 문제에서는 다소 향상되지만 인간 수준의 정확도(70% 이상)에 도달하지 못하여 내용에 익숙함으로서의 이점은 제한적임을 시사한다.
  • 제시 방식이 성능에 상당한 영향을 미치며, 고전적 방식이 가장 높은 정확도를 보였지만 향상 폭은 미미하다.
  • 기대치 못한 비인간적인 내용과 제시 방식 간의 상호작용이 관찰되어 인간 인지 모델이 예측하지 못한 추론 편향이 존재함을 시사한다.
  • LLMs는 카드 선택 행동이 일관되지 않으며, 특히 비사회적 및 현실적 규칙 조건에서 전제 조건 카드 선택에서 성능이 떨어진다.
  • 훈련 데이터와 아키텍처의 차이가 있음에도 불구하고 LLM 간 성능 패턴과 추론 편향이 놀랄 정도로 일관되게 나타나, 공통의 잠재적 인지 편향이 공통적으로 나타남을 시사한다.
Figure 2: Model performance by content type for arbitrary (AR), shuffled (SH), and realistic (RE) rules. RE contains both social and non-social rules. We do not find effects for LLM or familiarity, thus performance is collapsed. Relative to arbitrary content, most models result in a benefit for real
Figure 2: Model performance by content type for arbitrary (AR), shuffled (SH), and realistic (RE) rules. RE contains both social and non-social rules. We do not find effects for LLM or familiarity, thus performance is collapsed. Relative to arbitrary content, most models result in a benefit for real

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.