Skip to main content
QUICK REVIEW

[논문 리뷰] Disinformation Detection: An Evolving Challenge in the Age of LLMs

Bohan Jiang, Zhen Tan|arXiv (Cornell University)|2023. 09. 25.
Artificial Intelligence in Healthcare and Education인용 수 10
한 줄 요약

본 논문은 현재의 허위정보 탐지기가 LLM이 생성한 허위정보를 얼마나 강건하게 탐지하는지 평가하고, 탐지기로서의 LLM을 탐구하며, 새로운 LLM-생성 데이터셋으로 뒷받침되는 chain-of-thought prompting를 제안한다.

ABSTRACT

The advent of generative Large Language Models (LLMs) such as ChatGPT has catalyzed transformative advancements across multiple domains. However, alongside these advancements, they have also introduced potential threats. One critical concern is the misuse of LLMs by disinformation spreaders, leveraging these models to generate highly persuasive yet misleading content that challenges the disinformation detection system. This work aims to address this issue by answering three research questions: (1) To what extent can the current disinformation detection technique reliably detect LLM-generated disinformation? (2) If traditional techniques prove less effective, can LLMs themself be exploited to serve as a robust defense against advanced disinformation? and, (3) Should both these strategies falter, what novel approaches can be proposed to counter this burgeoning threat effectively? A holistic exploration for the formation and detection of disinformation is conducted to foster this line of research.

연구 동기 및 목표

  • LLM이 생성한 허위정보에 대해 기존 허위정보 탐지 기술의 강건성을 평가한다.
  • LLM 자신이 LLM이 생성한 허위정보를 탐지할 수 있는지 조사한다.
  • 전통적 방법이 실패할 경우 고급 혼합 콘텐츠 허위정보 탐지를 개선하기 위한 새롭고 프롬프트 기반의 접근법을 제안한다.

제안 방법

  • 세 가지 LLM-생성 허위정보 데이터셋(D_gpt_std, D_gpt_mix, D_gpt_cot)을 사람 작성 가짜 뉴스 기준에서 세 가지 프롬프트 기법으로 구성한다.
  • 사람 작성 허위정보에 대해 RoBERTa 기반 탐지기를 미세조정하고 LLM-생성 허위정보에 대한 성능을 평가한다.
  • 다양한 프롬프트하에서 LLM들(ChatGPT/GPT-3.5, GPT-4)을 탐지기로 평가해 능력과 변동성을 파악한다.
  • 사기 정보 탐지를 위해 맞춤형 chain-of-thought prompting을 개발·적용해 LLM이 콘텐츠를 사실 확인하도록 안내한다.
  • 탐지 성능에서 맥락적 요소(인물, 장소, 시간, 사건)의 중요성을 판단하기 위한 차감 실험을 수행한다.

실험 결과

연구 질문

  • RQ1RQ1: 기존의 허위정보 탐지 기술이 LLM이 생성한 허위정보에 적합한가?
  • RQ2RQ2: LLM 자체가 이러한 허위정보를 탐지하도록 조정될 수 있는가?
  • RQ3RQ3: 기존 방법이 실패할 경우 고급 LLM-생성 허위정보에 대응하기 위한 새로운 접근법은 무엇인가?

주요 결과

  • 미세조정된 RoBERTa는 단순한 LLM-생성 허위정보를 잘 탐지하지만 고급 프롬프트(예: chain-of-thought 프롬프트)에서는 잘못 분류하는 경향이 나타난다(77.93% 오분류).
  • RoBERTa 탐지기는 정치적 편향을 보이며 중도 성향의 콘텐츠를 자유주의적이거나 보수적인 콘텐츠보다 더 자주 진실로 잘못 분류한다.
  • 일반적인 ChatGPT는 자신이 생성한 허위정보를 탐지하는 데 어려움을 겪지만, 신중하게 설계된 chain-of-thought 프롬프트를 사용하면 정확도가 향상된다.
  • GPT-4는 일반적으로 GPT-3.5보다 LLM이 생성한 허위정보를 탐지하는 데 우수하며, 특히 분석 과정을 밝히도록 지시받았을 때 그렇다.
  • 해석적 추론(CoT)을 이끌어내는 프롬프트는 오분류를 크게 감소시키며, ablation 실험에서 GPT-4(all_scale)는 D_gpt_std에서 4.7%, D_gpt_mix에서 11.9%, D_gpt_cot에서 22.2%를 달성했다.
  • 본 연구는 세 가지 LLM-생성 데이터셋을 제공하고, 고급 프롬프팅과 추론 프롬프트가 LLM이 생성한 허위정보를 탐지하는 데 도움이 될 수 있음을 보인다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.