[논문 리뷰] Towards LLM-based Fact Verification on News Claims with a Hierarchical Step-by-Step Prompting Method
이 논문은 복잡한 뉴스 주장을 하위 주장으로 분해하고 외부 검색을 통한 단계별 추론을 통해 LLM 기반 사실 검증을 향상시키는 계층적 단계별(HiSS) 프롬프팅 방법을 제안한다. RAWFC 및 LIAR 데이터셋에서 평가한 결과, HiSS는 완전히 지도 학습된 최신 기술 모델보다 매크로 F1에서 4.95% 높은 성능을 기록했으며, 기존 베이스라인 대비 더 정확하고 이해하기 쉬우며 종합적인 설명을 생성한다.
While large pre-trained language models (LLMs) have shown their impressive capabilities in various NLP tasks, they are still under-explored in the misinformation domain. In this paper, we examine LLMs with in-context learning (ICL) for news claim verification, and find that only with 4-shot demonstration examples, the performance of several prompting methods can be comparable with previous supervised models. To further boost performance, we introduce a Hierarchical Step-by-Step (HiSS) prompting method which directs LLMs to separate a claim into several subclaims and then verify each of them via multiple questions-answering steps progressively. Experiment results on two public misinformation datasets show that HiSS prompting outperforms state-of-the-art fully-supervised approach and strong few-shot ICL-enabled baselines.
연구 동기 및 목표
- 대규모 언어 모델(LLM)을 사용한 뉴스 주장 검증에서 문맥 내 학습(ICL)의 효과성을 조사하는 것.
- 허위정보 맥락에서 기존 체인 오브 타ught(CoT) 프롬프팅의 주요 한계—예를 들어 사고의 누락 및 사실 환상 생성—를 해결하는 것.
- LLM를 사용하여 뉴스 주장을 세밀하게 단계별로 검증할 수 있는 계층적 프롬프팅 프레임워크를 설계하는 것.
- 구조화된 추론과 외부 증거 검색을 통해 LLM 기반 사실 검증의 정확성과 설명 가능성 향상
제안 방법
- HiSS 프롬프팅 방법은 두 단계로 구성된다: 주장 분해 및 하위주장 검증.
- 주장 분해 단계에서는 LLM이 복잡한 주장을 더 작은 논리적으로 독립적인 하위주장으로 나누도록 프롬프트한다.
- 각 하위주장에 대해 LLM은 체인 오브 타ught 추론 과정을 사용해 단계별로 검증을 수행한다.
- 외부 증거는 검색 엔진을 통해 검색되어 추론를 지지하고 환상 생성을 줄인다.
- 모델을 미세조정 없이도 안내하기 위해 4개의 예시를 사용한 few-shot 문맥 내 학습을 사용한다.
- 생성된 추론 체인의 품질과 일관성을 평가하기 위해 인간이 애너테이션한 설명을 사용한다.

실험 결과
연구 질문
- RQ1LLM를 사용한 few-shot 문맥 내 학습이 뉴스 주장 검증에서 완전히 지도 학습된 모델과 유사한 성능을 달성할 수 있는가?
- RQ2기본 체인 오브 타ught 프롬프팅이 사실 검증에서 표준 프롬프팅에 비해 성능이 열 劣하는 이유는 무엇인가?
- RQ3주장의 계층적 분해가 LLM 기반 검증에서 추론의 완전성 향상과 환상 감소에 기여하는가?
- RQ4외부 검색 통합이 LLM이 생성한 설명의 사실 일관성과 정확도에 어느 정도 향상 효과를 미치는가?
- RQ5HiSS가 생성한 추론의 설명 가능성은 인간이 작성한 설명과 기존 자동 베이스라인에 비해 어떻게 비교되는가?
주요 결과
- 단지 4개의 예시를 사용함으로써, ICL을 적용한 LLM은 뉴스 주장 검증에서 강력한 지도 학습 모델과 유사한 성능을 달성한다.
- 기본 체인 오브 타ught 프롬프팅은 핵심 주장 구성 요소의 누락과 환상적인 사실 생성으로 인해 성능이 열 劣한다.
- HiSS 프롬프팅 방법은 두 개의 벤치마크 데이터셋에서 최신 기술의 완전히 지도 학습 모델보다 평균적으로 매크로 F1을 4.95% 향상시켰다.
- 인간 평가 결과, HiSS가 생성한 설명은 CofCED 베이스라인에 비해 더 이해하기 쉽고 종합적이며, 커버리지 점수는 인간이 작성한 설명과 거의 유사하다.
- HiSS 설명은 CofCED 모델보다 더 읽기 쉽게 비중복성이 높지만, 여전히 황금 표준인 인간 설명에 비해 약간 떨어진다.
- 외부 검색 결과에 근거한 추론 지도로 사실 환상이 효과적으로 감소되었지만, 성능은 색인된 정보의 가용성에 의존한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.