[논문 리뷰] Fake News in Sheep's Clothing: Robust Fake News Detection Against LLM-Empowered Style Attacks
이 논문은 LLM 기반 뉴스 재구성과 내용 중심의 진실성 할당을 통해 LLM 기반 스타일 공격에 대해 높은 정확도를 유지하는 스타일 무관(fake news detector)인 SheepDog를 제안한다. 다양한 스타일로 재구성된 뉴스에 대해 예측 일관성을 강제로 유지하고, LLM으로부터 사실 확인 근거를 추출함으로써 SheepDog는 적대적 스타일 공격 하에서 베이스라인 대비 최대 38% 높은 F1 스코어를 달성한다. 이는 세 가지 벤치마크 데이터셋에서 강건성과 해석 가능성 모두를 입증한다.
It is commonly perceived that fake news and real news exhibit distinct writing styles, such as the use of sensationalist versus objective language. However, we emphasize that style-related features can also be exploited for style-based attacks. Notably, the advent of powerful Large Language Models (LLMs) has empowered malicious actors to mimic the style of trustworthy news sources, doing so swiftly, cost-effectively, and at scale. Our analysis reveals that LLM-camouflaged fake news content significantly undermines the effectiveness of state-of-the-art text-based detectors (up to 38% decrease in F1 Score), implying a severe vulnerability to stylistic variations. To address this, we introduce SheepDog, a style-robust fake news detector that prioritizes content over style in determining news veracity. SheepDog achieves this resilience through (1) LLM-empowered news reframings that inject style diversity into the training process by customizing articles to match different styles; (2) a style-agnostic training scheme that ensures consistent veracity predictions across style-diverse reframings; and (3) content-focused veracity attributions that distill content-centric guidelines from LLMs for debunking fake news, offering supplementary cues and potential intepretability that assist veracity prediction. Extensive experiments on three real-world benchmarks demonstrate SheepDog's style robustness and adaptability to various backbones.
연구 동기 및 목표
- 유명한 뉴스 소스를 모방하는 LLM 기반 스타일 공격에 취약한 최신 텍스트 기반 가짜 뉴스 탐지기의 취약점을 해결하기 위해.
- 글쓰기 스타일이 아닌 내용의 진실성에 초점을 맞춰 스타일 변형에 강건한 탐지 모델을 개발하기 위해.
- 사실 확인 근거를 활용해 LLM으로부터 내용 중심의 진실성 할당을 추출함으로써 설명 가능성 향상을 위해.
- 동일한 뉴스 컨텐츠의 다양한 스타일로 재구성된 경우에도 예측 일관성을 보장하는 훈련 프레임워크를 수립하기 위해.
제안 방법
- SheepDog는 스타일 중심의 프롬프트를 사용해 LLM 기반 뉴스 재구성 기법을 활용해 각 기사의 다양한 스타일 변형(신뢰할 만한 스타일과 신뢰할 수 없는 스타일 포함)을 생성한다.
- 원본 기사와 그 재구성된 버전들 사이의 예측 일관성을 극대화함으로써 스타일에 의존하지 않는 훈련을 수행함으로써 스타일 기반 신호에 대한 의존도를 감소시킨다.
- 사전 정의된 사실 확인 근거에 기반해 LLM이 뉴스를 평가하도록 프롬프트를 제공함으로써 내용 중심의 진실성 할당을 추출하고, 진실성에 대한 텍스트 기반 설명을 생성한다.
- 이러한 할당을 편의 레이블로 변환하여 모델을 지도학습시키며, 내용 중심의 학습을 강화한다.
- 진실성 예측과 할당 학습을 결합한 다중 작업 학습 목표를 갖춘 미세조정된 언어 모델 백본을 사용한다.
- 일반화성과 강건성을 확보하기 위해 다양한 언어 모델 백본과 재구성 프롬프트 조합을 기반으로 평가한다.

실험 결과
연구 질문
- RQ1최신 텍스트 기반 가짜 뉴스 탐지기는 LLM 기반 스타일 공격(유명한 뉴스 소스를 모방)에 얼마나 취약한가?
- RQ2LLM를 사용해 뉴스 컨텐츠를 다양한 글쓰기 스타일로 재구성할 경우, 가짜 뉴스 탐지기는 높은 성능을 유지할 수 있는가?
- RQ3LLM에서 유도된 내용 중심의 진실성 할당은 탐지의 강건성과 해석 가능성에 얼마나 기여하는가?
- RQ4동일한 컨텐츠의 다양한 스타일로 재구성된 경우에도 예측 일관성을 강제로 유지하면 더 신뢰할 수 있고 스타일에 무관한 탐지가 가능한가?
- RQ5제안된 방법은 다양한 뉴스 재구성 프롬프트와 모델 아키텍처에 대해 얼마나 일반화 가능한가?
주요 결과
- SheepDog는 LLM 기반 스타일 공격 하에서 F1 스코어 감소율이 베이스라인 대비 38% 상대적으로 감소하여 RoBERTa 및 기타 베이스라인보다 뚜렷이 뛰어난 성능을 보였다.
- PolitiFact, GossipCop, LUN 데이터셋에서 각각 F1 스코어 80.99, 74.45, 85.63을 기록하며 일관된 우월성을 입증했다.
- 제거 실험에서는 LLM 기반 재구성 또는 내용 중심 할당을 제거할 경우 성능 저하가 심각하게 발생함을 확인하여 이들이 핵심적인 역할을 한다는 점을 입증했다.
- SheepDog는 네 가지의 다른 재구성 프롬프트 조합(R1–R4)에서도 안정적인 성능을 유지하여 강력한 일반화성과 강건성을 보였다.
- 사례 연구 결과, SheepDog는 원본 및 적대적 방식으로 재구성된 가짜 뉴스를 모두 정확히 식별하는 반면, RoBERTa 베이스라인은 스타일 위장된 버전에서는 실패함을 확인했다.
- 모델의 상위 진실성 할당은 컨텐츠 내에서 틀리거나 오해의 소지가 있는 진술을 지칭하며, 이는 모델의 예측에 대한 설명 가능한 근거를 제공한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.