Skip to main content
QUICK REVIEW

[논문 리뷰] Towards LLM-based Fact Verification on News Claims with a Hierarchical Step-by-Step Prompting Method

Xuan Zhang, Wei Gao|arXiv (Cornell University)|2023. 09. 30.
Topic Modeling인용 수 4
한 줄 요약

이 논문은 복잡한 뉴스 주장을 하위 주장으로 분해하고 외부 검색을 통한 단계별 추론을 통해 LLM 기반 사실 검증을 향상시키는 계층적 단계별(HiSS) 프롬프팅 방법을 제안한다. RAWFC 및 LIAR 데이터셋에서 평가한 결과, HiSS는 완전히 지도 학습된 최신 기술 모델보다 매크로 F1에서 4.95% 높은 성능을 기록했으며, 기존 베이스라인 대비 더 정확하고 이해하기 쉬우며 종합적인 설명을 생성한다.

ABSTRACT

While large pre-trained language models (LLMs) have shown their impressive capabilities in various NLP tasks, they are still under-explored in the misinformation domain. In this paper, we examine LLMs with in-context learning (ICL) for news claim verification, and find that only with 4-shot demonstration examples, the performance of several prompting methods can be comparable with previous supervised models. To further boost performance, we introduce a Hierarchical Step-by-Step (HiSS) prompting method which directs LLMs to separate a claim into several subclaims and then verify each of them via multiple questions-answering steps progressively. Experiment results on two public misinformation datasets show that HiSS prompting outperforms state-of-the-art fully-supervised approach and strong few-shot ICL-enabled baselines.

연구 동기 및 목표

  • 대규모 언어 모델(LLM)을 사용한 뉴스 주장 검증에서 문맥 내 학습(ICL)의 효과성을 조사하는 것.
  • 허위정보 맥락에서 기존 체인 오브 타ught(CoT) 프롬프팅의 주요 한계—예를 들어 사고의 누락 및 사실 환상 생성—를 해결하는 것.
  • LLM를 사용하여 뉴스 주장을 세밀하게 단계별로 검증할 수 있는 계층적 프롬프팅 프레임워크를 설계하는 것.
  • 구조화된 추론과 외부 증거 검색을 통해 LLM 기반 사실 검증의 정확성과 설명 가능성 향상

제안 방법

  • HiSS 프롬프팅 방법은 두 단계로 구성된다: 주장 분해 및 하위주장 검증.
  • 주장 분해 단계에서는 LLM이 복잡한 주장을 더 작은 논리적으로 독립적인 하위주장으로 나누도록 프롬프트한다.
  • 각 하위주장에 대해 LLM은 체인 오브 타ught 추론 과정을 사용해 단계별로 검증을 수행한다.
  • 외부 증거는 검색 엔진을 통해 검색되어 추론를 지지하고 환상 생성을 줄인다.
  • 모델을 미세조정 없이도 안내하기 위해 4개의 예시를 사용한 few-shot 문맥 내 학습을 사용한다.
  • 생성된 추론 체인의 품질과 일관성을 평가하기 위해 인간이 애너테이션한 설명을 사용한다.
Figure 1: An example of claim verification based on vanilla CoT prompting. The claim (underlined) and CoT (in green) are given as a demonstration. The generated CoT (in italics) leads to an incorrect judgment due to (1) omission of necessary thoughts regarding “nukes”, and (2) fact hallucination abo
Figure 1: An example of claim verification based on vanilla CoT prompting. The claim (underlined) and CoT (in green) are given as a demonstration. The generated CoT (in italics) leads to an incorrect judgment due to (1) omission of necessary thoughts regarding “nukes”, and (2) fact hallucination abo

실험 결과

연구 질문

  • RQ1LLM를 사용한 few-shot 문맥 내 학습이 뉴스 주장 검증에서 완전히 지도 학습된 모델과 유사한 성능을 달성할 수 있는가?
  • RQ2기본 체인 오브 타ught 프롬프팅이 사실 검증에서 표준 프롬프팅에 비해 성능이 열 劣하는 이유는 무엇인가?
  • RQ3주장의 계층적 분해가 LLM 기반 검증에서 추론의 완전성 향상과 환상 감소에 기여하는가?
  • RQ4외부 검색 통합이 LLM이 생성한 설명의 사실 일관성과 정확도에 어느 정도 향상 효과를 미치는가?
  • RQ5HiSS가 생성한 추론의 설명 가능성은 인간이 작성한 설명과 기존 자동 베이스라인에 비해 어떻게 비교되는가?

주요 결과

  • 단지 4개의 예시를 사용함으로써, ICL을 적용한 LLM은 뉴스 주장 검증에서 강력한 지도 학습 모델과 유사한 성능을 달성한다.
  • 기본 체인 오브 타ught 프롬프팅은 핵심 주장 구성 요소의 누락과 환상적인 사실 생성으로 인해 성능이 열 劣한다.
  • HiSS 프롬프팅 방법은 두 개의 벤치마크 데이터셋에서 최신 기술의 완전히 지도 학습 모델보다 평균적으로 매크로 F1을 4.95% 향상시켰다.
  • 인간 평가 결과, HiSS가 생성한 설명은 CofCED 베이스라인에 비해 더 이해하기 쉽고 종합적이며, 커버리지 점수는 인간이 작성한 설명과 거의 유사하다.
  • HiSS 설명은 CofCED 모델보다 더 읽기 쉽게 비중복성이 높지만, 여전히 황금 표준인 인간 설명에 비해 약간 떨어진다.
  • 외부 검색 결과에 근거한 추론 지도로 사실 환상이 효과적으로 감소되었지만, 성능은 색인된 정보의 가용성에 의존한다.
Figure 2: Overview of the proposed HiSS model: Original human inputs are in red background, LLM directly generated text is in white, and answers generated based on search results are in green. We start by providing a few-shot demonstration, followed by appending the claim to be checked (underlined).
Figure 2: Overview of the proposed HiSS model: Original human inputs are in red background, LLM directly generated text is in white, and answers generated based on search results are in green. We start by providing a few-shot demonstration, followed by appending the claim to be checked (underlined).

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.