[논문 리뷰] Fake News Detectors are Biased against Texts Generated by Large Language Models
이 논문은 가짜 뉴스 탐지기가 LLM-생성 콘텐츠를 가짜로 분류하는 편향이 있음을 밝혀내고, LLM-패러프레이즈된 실제 뉴스와의 적대적 학습으로 편향을 제거하는 방법을 제안하며, 새로운 GossipCop++ 및 PolitiFact++ 데이터셋으로 뒷받침한다.
The spread of fake news has emerged as a critical challenge, undermining trust and posing threats to society. In the era of Large Language Models (LLMs), the capability to generate believable fake content has intensified these concerns. In this study, we present a novel paradigm to evaluate fake news detectors in scenarios involving both human-written and LLM-generated misinformation. Intriguingly, our findings reveal a significant bias in many existing detectors: they are more prone to flagging LLM-generated content as fake news while often misclassifying human-written fake news as genuine. This unexpected bias appears to arise from distinct linguistic patterns inherent to LLM outputs. To address this, we introduce a mitigation strategy that leverages adversarial training with LLM-paraphrased genuine news. The resulting model yielded marked improvements in detection accuracy for both human and LLM-generated news. To further catalyze research in this domain, we release two comprehensive datasets, exttt{GossipCop++} and exttt{PolitiFact++}, thus amalgamating human-validated articles with LLM-generated fake and real news.
연구 동기 및 목표
- 현실적인 가짜 뉴스 탐지기 평가를 인간이 쓴 정보와 LLM-생성 허위정보 모두에서 수행하도록 동기를 부여한다.
- 탐지기가 LLM-생성 콘텐츠에 대해 가지는 편향을 특징짓는다.
- 탐지 편향의 근간이 될 수 있는 언어적 특징(NELA)을 조사한다.
- LLM-패러프레이즈된 실제 뉴스를 이용한 적대적 학습(adversarial training)을 활용한 편향 제거 방법을 개발한다.
- 벤치마크 및 재현을 위해 새로운 데이터셋(GossipCop++ 및 PolitiFact++)를 제공한다.]
- method:[
- 사기 뉴스 탐지를 위한 Pre-LLM 및 LLM-시대의 작업 형식을 정의한다.
- ChatGPT를 통한 구조적 모방 프롬프트(SMP)로 LLM-합성 콘텐츠를 생성하여 PolitiFact++ 및 GossipCop++ 데이터셋을 만든다.
- HR, HF, MF 하위집합에서 다수의 탐지기(RoBERTa, BERT, ELECTRA, ALBERT, DeBERTa)를 평가한다.
- NELA-콘텐츠 특징 및 Tukey 쌍태검정 등의 통계적 검정을 통해 편향의 근원을 분석한다.
- LLM-패러프레이즈된 실제 뉴스를 이용한 적대적 학습 기반의 편향 제거 전략을 제안한다.
- 인간- 및 LLM-생성 콘텐츠 간의 성능 변화로 편향 제거의 영향을 평가한다.]
- research_questions:[
- RQ1: PolitiFact++ 및 GossipCop++에서 인간이 쓴 실제, 인간이 쓴 가짜, LLM-생성 가짜 콘텐츠에 대해 가짜 뉴스 탐지기가 얼마나 잘 작동하는가?
- RQ2: 탐지기가 왜 LLM-생성 뉴스에 편향을 보이며 이 편향과 상관되는 특징은 무엇인가?
- RQ3: 편향이 완화될 수 있는가, 그리고 LLM-패러프레이즈된 실제 뉴스로의 적대적 학습이 콘텐츠 유형 간 탐지에 어떤 영향을 미치는가?
제안 방법
- 정의 Pre-LLM 및 LLM-era 작업 형식을 가짜 뉴스 탐지에 대하여 정의한다.
- Structured Mimicry Prompting(SMP)를 사용한 ChatGPT로 LLM-합성 콘텐츠를 생성하여 PolitiFact++ 및 GossipCop++ 데이터셋을 만든다.
- HR, HF, MF 하위집합에서 RoBERTa, BERT, ELECTRA, ALBERT, DeBERTa 등 여러 탐지기를 평가한다.
- NELA-콘텐츠 특징과 통계적 검정(Tukey 쌍태 등)을 분석하여 편향의 원인을 식별한다.
- LLM-패러프레이즈된 실제 뉴스를 이용한 적대적 학습 기반의 편향 제거 전략을 제안한다.
- 인간- 및 LLM-생성 콘텐츠 전반에 걸친 성능 변화를 통해 편향 제거의 영향을 평가한다.]
- research_questions_translation_only:
- key_findings:[
- 탐지기들이 LLM-생성 콘텐츠에 편향되어 있으며, 종종 진실한 LLM 출력마저도 가짜로 잘못 분류한다.
- NELA-콘텐츠 특징은 인간이 쓴 가짜와 LLM-생성 가짜 사이에 유의한 차이를 보이며, 탐지기가 LLM 출력에 특유한 언어 패턴에 의존할 수 있음을 시사한다.
- 회귀 기반 모델을 이용한 편향 제거가 성능을 바꾸며, 인간이 쓴 가짜 뉴스에 대한 탐지에는 개선을 보이나 LLM-생성의 경우 때때로 감소를 보인다.
- LLM-패러프레이즈된 실제 뉴스를 이용한 적대적 학습은 일반화를 개선하여, 데이터셋 전반에서 인간-쓴 및 LLM-생성 콘텐츠 모두에 대한 탐지 성능을 향상시킨다.
- 두 개의 향상된 데이터셋 GossipCop++ 및 PolitiFact++는 원래의 인간이 쓴 기사를 LLM-합성 콘텐츠와 페어링하여 탐지기를 벤치마크한다.

실험 결과
주요 결과
- 탐지기들은 LLM-생성 콘텐츠에 편향되어 있으며, 종종 진실한 LLM 출력은 가짜로 잘못 분류된다.
- NELA-콘텐츠 특징은 인간이 쓴 가짜와 LLM-생성 가짜 사이에 유의한 차이를 보이며, 탐지기가 LLM 출력에 특유한 언어 패턴에 의존할 수 있음을 시사한다.
- 편향 제거를 위한 회귀 기반 모델은 성능에 변화를 주며, 인간이 쓴 가짜 뉴스에 대한 탐지에는 향상을 보이나 LLM-생성의 경우 때때로 감소를 보인다.
- 적대적 학습(LLM-패러프레이즈된 실제 뉴스 사용)이 일반화를 개선하고, 데이터셋 전반에서 인간-쓴 및 LLM-생성 콘텐츠에 대한 탐지 성능을 향상시킨다.
- 향상된 데이터셋 GossipCop++ 및 PolitiFact++은 원래의 인간 쓴 기사와 LLM-합성 콘텐츠를 페어링하여 탐지기를 벤치마크한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.