[논문 리뷰] Can Large Language Models Detect Rumors on Social Media?
이 논문은 뉴스 기사와 소셜미디어 사용자 댓글을 분석하기 위해 대규모 언어 모델(Large Language Models, LLMs)을 활용하는 제로샷 루머 감지 프레임워크인 LeRuD을 제안한다. LeRuD는 확산 정보를 '확산 사슬(Chain-of-Propagation)'으로 구조화하고, 특정 프롬프트를 통해 글쓰기 스타일, 일반지식적 모순, 댓글 간 갈등과 같은 핵심 단서에 초점을 맞추도록 LLM을 이끌어낸다. LeRuD는 트위터와 웨이보 데이터셋에서 훈련 데이터를 전혀 필요로 하지 않음에도 불구하고 최신 기술 모델들보다 3.2%에서 7.7% 높은 성능을 달성한다.
In this work, we investigate to use Large Language Models (LLMs) for rumor detection on social media. However, it is challenging for LLMs to reason over the entire propagation information on social media, which contains news contents and numerous comments, due to LLMs may not concentrate on key clues in the complex propagation information, and have trouble in reasoning when facing massive and redundant information. Accordingly, we propose an LLM-empowered Rumor Detection (LeRuD) approach, in which we design prompts to teach LLMs to reason over important clues in news and comments, and divide the entire propagation information into a Chain-of-Propagation for reducing LLMs' burden. We conduct extensive experiments on the Twitter and Weibo datasets, and LeRuD outperforms several state-of-the-art rumor detection models by 3.2% to 7.7%. Meanwhile, by applying LLMs, LeRuD requires no data for training, and thus shows more promising rumor detection ability in few-shot or zero-shot scenarios.
연구 동기 및 목표
- 대규모 언어 모델(LLMs)이 뉴스 기사와 댓글을 포함한 전체 확산 정보를 활용해 소셜미디어 루머를 효과적으로 감지할 수 있는지 조사하기 위해.
- 확산 데이터에서 장기간이고 반복적인 댓글 시퀀스로 인해 LLM이 핵심 단서에 집중하지 못하고 어려움을 겪는 문제를 해결하기 위해.
- 시간 순서로 정렬된 확산 패턴을 단계별로 추론할 수 있도록 프롬프트 기반 추론 프레임워크를 설계하기 위해.
- LLM의 제로샷 능력을 평가하여 피니테이닝이나 레이블이 붙은 훈련 데이터에 대한 의존도를 최소화하기 위해.
- 적절히 이끌어진 LLM이 피니테이닝 없이도 기존 모델들을 능가할 수 있음을 입증하기 위해.
제안 방법
- 논문은 뉴스 기사의 확산 과정을 시간 순서로 정렬된 '확산 사슬(Chain-of-Propagation)'으로 구조화하여, 맥락 길이를 줄이고 추론 효율성을 향상시킨다.
- 사용자 댓글의 글쓰기 스타일과 일반지식적 모순(예: 비현실적인 주장이나 과장된 어조)을 분석할 수 있도록 맞춤형 프롬프트를 설계한다.
- 반론, 모순 또는 대립되는 의견을 탐지하기 위해 별도의 프롬프트를 사용하여 다각도의 추론을 가능하게 한다.
- 프레임워크는 피니테이닝 없이 GPT-3.5를 제로샷 설정에서 사용하여 저자원 환경에서도 일반화 능력을 확보한다.
- 데이터 泄露 및 편향을 방지하기 위해 알려진 사실이나 민감한 내용을 포함한 샘플을 제거하기 위해 윤리적 필터링을 적용한다.
- 최종 판단은 단계별 분석 결과를 종합하여 도출되며, 뉴스 기사 신뢰성 평가와 댓글 정서/갈등 탐지에서의 증거를 통합한다.

실험 결과
연구 질문
- RQ1LLM이 뉴스 기사와 댓글을 포함한 전체 확산 정보를 제공받을 경우, 소셜미디어 루머를 효과적으로 감지할 수 있는가?
- RQ2LLM의 성능은 제로샷 또는 피셔롯 설정에서 피니테이닝된 모델과 비교해 어떻게 되는가?
- RQ3프롬프트 엔지니어링과 구조화된 추론(확산 사슬)이, 잡음이 많고 긴 댓글 스트림에서 핵심 단서에 집중하는 데 도움이 되는가?
- RQ4글쓰기 스타일, 일반지식 오류, 댓글 갈등 등의 유형 중 어떤 단서가 LLM 기반 루머 감지에 가장 효과적인가?
- RQ5시간 순서로 정렬된 확산 데이터를 구조화함으로써 LLM의 추론 능력과 감지 정확도가 향상되는가?
주요 결과
- LeRuD는 트위터와 웨이보 데이터셋에서 제로샷 평가에서 몇몇 최신 기술 루머 감지 모델보다 3.2%에서 7.7% 높은 성능을 기록한다.
- 모델은 피니테이닝 없이도 높은 성능을 달성하여 저자원 또는 제로샷 환경에서 강력한 일반화 능력을 보여준다.
- 프롬프트 엔지니어링이 효과적으로 LLM의 주의를 글쓰기 스타일 이상 징후나 댓글 갈등과 같은 핵심 지표에 집중시켜 감지 정확도를 향상시킨다.
- 확산 사슬(Chain-of-Propagation)의 구조화는 각 단계에서 맥락 길이를 제한함으로써 LLM의 추론 부담을 줄여 장기간의 댓글 스트림에 대해서도 더 정확하고 안정적인 추론을 가능하게 한다.
- 반론이나 논리적 모순이 없는 것을 탐지함으로써, 감정적으로 격해지거나 모호한 사건의 경우에도 실제 뉴스를 정확히 식별할 수 있다.
- 입력 길이 제약이 존재하더라도, LeRuD는 반복적이거나 관련 없는 댓글을 걸러내고 핵심 증거에 집중함으로써 높은 성능을 유지한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.