Skip to main content
QUICK REVIEW

[논문 리뷰] Towards LogiGLUE: A Brief Survey and A Benchmark for Analyzing Logical Reasoning Capabilities of Language Models

Man Luo, Shrinidhi Kumbhar|arXiv (Cornell University)|2023. 10. 02.
Semantic Web and Ontologies인용 수 5
한 줄 요약

이 논문은 추론의 종류인 연역, 암시적, 귀납적 추론을 포함하는 24개의 다양한 논리적 추론 데이터셋을 통합한 종합적 벤치마크인 LogiGLUE를 소개한다. 이는 일관된 훈련 및 평가를 위해 모두 Seq2Seq 작업으로 표준화되었다. 또한, 체인 오브 써포트 추론에서의 지식 정제를 통해 15,000개의 훈련 샘플을 사용할 경우 일반화 능력이 크게 향상되는 강력한 성능을 보이는 LogiT5라는 미세조정된 모델을 제안한다.

ABSTRACT

Logical reasoning is fundamental for humans yet presents a substantial challenge in the domain of Artificial Intelligence. Initially, researchers used Knowledge Representation and Reasoning (KR) systems that did not scale and required non-trivial manual effort. Recently, the emergence of large language models (LLMs) has demonstrated the ability to overcome various limitations of formal Knowledge Representation (KR) systems. Consequently, there's a growing interest in using LLMs for logical reasoning via natural language. This work strives to understand the proficiency of LLMs in logical reasoning by offering a brief review of the latest progress in this area; with a focus on the logical reasoning datasets, tasks, and the methods adopted to utilize LLMs for reasoning. To offer a thorough analysis, we have compiled a benchmark titled LogiGLUE. This includes 24 varied datasets encompassing deductive, abductive, and inductive reasoning. Utilizing LogiGLUE as a foundation, we have trained an instruction fine-tuned language model, resulting in LogiT5. We study single-task training, multi-task training, and "chain-of-thought" knowledge distillation fine-tuning technique to assess the performance of model across the different logical reasoning categories. We also assess various LLMs using LogiGLUE, and the findings indicate that LLMs excel most in abductive reasoning, followed by deductive reasoning, while they are least effective at inductive reasoning. We aim to shed light on the capabilities and potential pathways for enhancing logical reasoning proficiency in LLMs, paving the way for more advanced and nuanced developments in this critical field.

연구 동기 및 목표

  • 기존의 데이터셋, 작업 및 방법론을 체계적으로 조사하여 대규모 언어 모델(LM)의 논리적 추론 능력의 현재 상태를 평가하기 위해.
  • LLM에서 논리적 추론을 위한 표준화된 평가 벤치마크의 부족을 해결하기 위해, 24개의 다양한 데이터셋을 통합한 통합 벤치마크인 LogiGLUE를 구축하기 위해.
  • 특히 체인 오브 써포트 프롬프팅을 활용한 지침 미세조정 및 지식 정제 기법을 통해 LLM의 추론 성능을 향상시키기 위해.
  • LLM이 도메인 외 추론 작업에서의 일반화 능력을 평가하여 제로샷 추론에서의 한계를 규명하기 위해.
  • 논리적 추론 분야의 향후 연구를 가속화하기 위해 LogiGLUE 벤치마크와 LogiT5 모델을 오픈소스로 제공하기 위해.

제안 방법

  • 저자들은 추론 유형(연역, 암시적, 귀납적 추론 포함)의 다양성을 고려하여 24개의 기존 논리적 추론 데이터셋을 통합된 Seq2Seq 형식으로 변환하여 훈련 및 평가의 표준화를 도모했다.
  • 단일 작업, 다중 작업 및 체인 오브 써포트(CoT) 지식 정제 전략을 사용하여 Flan-T5 모델을 LogiGLUE에 대해 미세조정하여 다양한 추론 유형에서의 성능을 평가했다.
  • CoT 정제를 위해, LLaMA-7B가 LogiQA 데이터셋에서 추론 흐름을 생성하였으며, 정답을 포함한 샘플을 선별하여 3,000개, 6,000개, 15,000개의 훈련 세트를 생성하였다.
  • CoT 미세조정 중 훈련 안정성을 확보하기 위해 더 높은 초기 학습률(3e-4)과 더 긴 훈련(40 에포크)을 적용하였으며, 더 큰 CoT 데이터 볼륨을 사용할수록 성능 향상이 관찰되었다.
  • 도메인 외 일반화 능력을 평가하기 위해, '한 번씩 생각해 봅시다' 프롬프트를 사용한 제로샷 프롬프팅을 적용하였고, LLaMA-2 출력에서 어휘 유사성을 매칭하기 위해 ConceptNet을 활용하였다.
  • Flan-T5의 성능은 LogiGLUE(내부 도메인) 및 ReClor, Winogrande, BigBench, PrOntoQA-OOD(외부 도메인)와 같은 외부 도메인 데이터셋에서 정확도 기반 및 어휘 유사성 기반 매칭을 통해 평가되었다.
Figure 1: Logical Reasoning Survey: Datasets and Language Model Application.
Figure 1: Logical Reasoning Survey: Datasets and Language Model Application.

실험 결과

연구 질문

  • RQ1대규모 언어 모델은 다양한 도메인 외 데이터셋에서 논리적 추론 능력을 일반화할 수 있는가? 제로샷 추론 능력의 한계는 무엇인가?
  • RQ2체인 오브 써포트 지식 정제 기법은 논리적 추론 성능 향상에 얼마나 효과적인가? 정제된 CoT 훈련 데이터의 크기가 모델 성능에 영향을 미치는가?
  • RQ3LogiGLUE에서 다중 작업 미세조정은 단일 작업 또는 미세조정 없이 수행된 기준 모델 대비 추론 성능 향상에 기여하는가?
  • RQ4특히 분포가 다른 환경에서 LLM은 진정한 논리적 추론이 아닌 기억된 사실의 재활용 또는 검색에 의존하는 정도는 어느 정도인가?
  • RQ5'한 번씩 생각해 봅시다'와 같은 다양한 프롬프팅 전략은 Flan-T5 및 LLaMA-2 등의 모델에서 추론 성능에 어떤 영향을 미치는가?

주요 결과

  • LogiT5는 내부 도메인인 LogiGLUE 벤치마크에서 평균 정확도 51.24%를 기록하여 다양한 추론 유형에서 강력한 성능을 보였다.
  • 도메인 외 일반화 능력은 제한적이었다: LLaMA-2는 PrOntoQA-OOD에서 6.50%, WaNLI에서 15.54%의 성능을 기록하여 새로운 작업에서의 제로샷 추론 능력이 열악함을 시사했다.
  • 15,000개의 CoT 샘플을 사용할 경우 체인 오브 써포트 정제로 성능이 4% 향상되었으며, 이는 더 큰, 고품질의 추론 데이터가 모델의 일반화 능력을 향상시킨다는 것을 보여주었다.
  • 3,000개 및 6,000개의 CoT 샘플을 사용한 CoT 정제는 기준 미세조정 대비 성능 향상이 없었으며, 이는 정제 성과에 있어 데이터 양의 중요성이 핵심임을 시사했다.
  • Flan-T5는 지침 미세조정 및 템플릿 기반 생성 방식 덕분에 더 안정적인 평가가 가능하여, 구조화된 벤치마크에서 LLaMA-2보다 뛰어난 성능을 보였다.
  • 수동 분석 결과, LLaMA-2는 종종 어휘 기반의 답변을 생성하거나 입력을 무시하는 경향을 보여, 맥락에서의 진정한 논리적 추론보다 기억된 지식에 의존하는 것으로 나타났다.
Figure 2: Examples (top) of three types of logical reasoning and explanations (bottom) correlating each example with its respective reasoning type.
Figure 2: Examples (top) of three types of logical reasoning and explanations (bottom) correlating each example with its respective reasoning type.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.