[논문 리뷰] Assessing the Reasoning Capabilities of LLMs in the context of Evidence-based Claim Verification
이 논문은 주장과 뉴스 조작 정보 검증을 원자적 추론 단계로 분해하는 새로운 논리적 추론 프레임워크를 제안한다. GPT-3.5-Turbo와 GPT-4의 성능을 평가하기 위해 두 가지 수동으로 애너테이션된 데이터셋—위키백과 주장과 트위터 뉴스 조작 정보—을 사용한다. 주요 발견 결과로는, 모델들이 추론 능력에서는 뛰어나지만 특히 실제 뉴스 조작 정보에서 추론 능력이 크게 떨어지며, 특히 추론 능력이 떨어지는 데서 기인한 것으로 보인다. 또한 체인 오브 썬스(Chain-of-Thought) 프롬프팅은 제로샷 접근 방식보다 설명의 품질을 향상시킨다.
Although LLMs have shown great performance on Mathematics and Coding related reasoning tasks, the reasoning capabilities of LLMs regarding other forms of reasoning are still an open problem. Here, we examine the issue of reasoning from the perspective of claim verification. We propose a framework designed to break down any claim paired with evidence into atomic reasoning types that are necessary for verification. We use this framework to create RECV, the first claim verification benchmark, incorporating real-world claims, to assess the deductive and abductive reasoning capabilities of LLMs. The benchmark comprises of three datasets, covering reasoning problems of increasing complexity. We evaluate three state-of-the-art proprietary LLMs under multiple prompt settings. Our results show that while LLMs can address deductive reasoning problems, they consistently fail in cases of abductive reasoning. Moreover, we observe that enhancing LLMs with rationale generation is not always beneficial. Nonetheless, we find that generated rationales are semantically similar to those provided by humans, especially in deductive reasoning cases.
연구 동기 및 목표
- 주장과 뉴스 조작 정보 검증을 원자적 추론 단계로 체계적으로 분해하는 프레임워크를 개발하기 위해.
- 실제 복잡한 뉴스 조작 정보 검증 작업에서 LLM의 추론 능력을 체계적으로 평가할 수 있는 평가 기준의 부재를 해결하기 위해.
- ChatGPT와 같은 LLM이 유포되는 오해 정보에 핵심적인 역할을 하는 추론 능력에서 신뢰할 수 있는 성능을 보이는지 조사하기 위해.
- 제로샷, 제로샷 체인 오브 썬스, 수동 체인 오브 썬스 프롬프팅의 효과성을 비교하여 추론 품질 향상에 기여하는지 분석하기 위해.
- 고위험 검증 작업에서 LLM의 한계에 대한 실증적 증거를 제공하여 과도한 기대를 넘어서 측정 가능한 능력 수준을 도출하기 위해.
제안 방법
- 주장과 증거를 추론 경로, 추론 방식(추론/추론), 추론 과정으로 분해하는 논리적 추론 프레임워크를 제안한다.
- 위키백과(폐쇄 세계 가정을 수반하는 주장)에서 유래한 데이터셋과 PHEME 데이터셋(실제 뉴스 조작 정보, 개방 세계 복잡성 포함)에서 유래한 두 가지 수동 애너테이션된 데이터셋을 구축한다.
- 추론 방식에 따라 분류: 추론(예: 수학적, 시간적) 대비 추론(예: 인과 추론, 타당성 평가).
- GPT-3.5-Turbo와 GPT-4를 제로샷(ZS), 제로샷 체인 오브 썬스(ZS CoT), 수동 체인 오브 썬스(Manual CoT) 프롬프팅 세 가지 방식으로 평가한다.
- 세 분류 분류(진실, 거짓, 미확인)를 사용해 모델 성능을 평가하며, 전문가가 애너테이션한 추론 경로를 기준으로 참값 레이블을 확보한다.
- 특히 추론 사례에서 모델의 설명이 핵심이 되는 경우, 추론 품질을 평가하기 위해 정성적 분석을 수행한다.

실험 결과
연구 질문
- RQ1주장과 뉴스 조작 정보 검증을 원자적이고 해석 가능한 추론 단계로 분해할 수 있는 체계적 논리적 추론 프레임워크를 설계할 수 있는가?
- RQ2GPT-3.5-Turbo와 GPT-4 같은 LLM은 단순한 사실 주장보다 실제 뉴스 조작 정보 검증에서 어떻게 성능을 내는가?
- RQ3체인 오브 썬스 프롬프팅은 제로샷 추론에 비해 추론 능력이 떨어지는 추론 작업에서 추론의 품질과 정확도를 향상시키는가?
- RQ4증거가 모호하거나 불완전할 경우, LLM은 추론에서 힌트나 우연한 관련성에 너무 의존하는가?
- RQ5검증 작업에서 LLM의 추론 과정은 인간과 유사한가, 아니면 '클리버 한스' 행동과 같은 체계적인 결함을 보이는가?
주요 결과
- GPT-4는 수동 체인 오브 썬스에서 위키백과 기반 데이터셋에서 97.4%의 정확도를 기록했지만, PHEME 기반 뉴스 조작 정보 데이터셋에서는 52.6%에 그쳐 실제 복잡성에 대비해 성능이著しく 떨어지는 것으로 나타났다.
- 추론 능력 테스트에서 GPT-4는 제로샷 프롬프팅 시 33.3%의 정확도를 기록했고, 제로샷 체인 오브 썬스로 개선되어 44.4%로 상승했지만, 복잡한 다중 요소 뉴스 조작 정보에서는 여전히 성능이 열등했다.
- 수동 체인 오브 썬스는 제로샷 또는 제로샷 체인 오브 썬스에 비해 더 높은 품질의 설명을 제공했으며, 특히 추론 사례에서 추론 경로가 더 논리적이고 일관성이 있었다.
- GPT-3.5-Turbo 역시 유사한 경향을 보였으며, 추론 작업에서는 76.7%의 정확도를 기록했지만, 추론 작업에서는 제로샷에서 33.3%에 그쳐 비추론 추론 처리 능력에 근본적인 한계가 있음을 시사했다.
- 강한 증거가 없을 경우, 모델은 타당해 보이지만 근거 없는 추론에 기반해 미확인 주장들을 진실 또는 거짓으로 잘못 분류하는 경향이 있었다.
- 체인 오브 썬스 프롬프팅을 사용한 후에도, 모델들은 추론 능력이 떨어지는 주장에 대해 일관되게 올바른 추론 경로를 생성하지 못했으며, 이는 현재의 LLM이 인간과 유사한 추론 능력을 수행하지 못하고 오히려 패턴 기반 힌트에 의존하고 있음을 시사한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.