Skip to main content
QUICK REVIEW

[논문 리뷰] Analysis of Disinformation and Fake News Detection Using Fine-Tuned Large Language Model

Bohdan M. Pavlyshenko|arXiv (Cornell University)|2023. 09. 09.
Misinformation and Its Impacts인용 수 13
한 줄 요약

이 논문은 PEFT/LoRA를 사용하여 Llama 2를 미세조정해 멀티태스크 허위정보 분석을 수행하며, fake news 탐지, 선전 서사 하이라이트, 사실 확인, 조작 분석, 및 명명 엔티티 감성 추출 등을 포함합니다. Twitter 데이터에 대해 fake news 탐지 및 서사 분석에서 질적 결과와 주목할 만한 정량적 결과(F1=0.95)를 보여줍니다.

ABSTRACT

The paper considers the possibility of fine-tuning Llama 2 large language model (LLM) for the disinformation analysis and fake news detection. For fine-tuning, the PEFT/LoRA based approach was used. In the study, the model was fine-tuned for the following tasks: analysing a text on revealing disinformation and propaganda narratives, fact checking, fake news detection, manipulation analytics, extracting named entities with their sentiments. The obtained results show that the fine-tuned Llama 2 model can perform a deep analysis of texts and reveal complex styles and narratives. Extracted sentiments for named entities can be considered as predictive features in supervised machine learning models.

연구 동기 및 목표

  • 소셜 미디어와 뉴스 흐름에서 허위정보와 가짜 뉴스 탐지의 필요성을 동기 부여합니다.
  • 미세조정된 Llama 2 LLM이 허위정보 분석 작업에서 멀티태스크를 수행할 수 있는지 평가합니다.
  • 작은 데이터 세트에서 효율적인 학습을 가능하게 하는 PEFT/LoRA 기반 미세조정 파이프라인을 개발합니다.

제안 방법

  • 4-bit 양자화와 SFTTrainer와 같은 트레이너를 사용하여 PEFT/LoRA로 Llama 2-7B-chat을 미세조정합니다.
  • LLM이 텍스트를 허위정보 분석, 주요 포인트 하이라이트, 요약 및 명명 엔티티와 감성을 추출하도록 프롬프트 지시문을 사용합니다.
  • 가짜 뉴스 데이터 세트와 러시아 선전 서사 데이터를 학습 데이터에 포함합니다; 데이터를 학습/검증으로 분할합니다(검증은 25%).
  • 허위정보 분석, 선전 서사 하이라이트, 사실 확인, 가짜 뉴스 탐지, 조작 분석 및 엔티티 감성 추출 등 작업에서 산출물을 평가합니다.
Figure 1: Time series of tweets for the query ’ukraine’.
Figure 1: Time series of tweets for the query ’ukraine’.

실험 결과

연구 질문

  • RQ1미세조정된 Llama 2 모델이 구조화된, 잠재적으로 JSON 형식의 출력을 제공하는 멀티태스크 허위정보 분석을 수행할 수 있는가?
  • RQ2PEFT/LoRA 기반 미세조정과 4-bit 양자화가 허위정보 작업에 효과적이고 자원 효율적인 적응을 가능하게 하는가?
  • RQ3추출된 엔티티 감성이 미디어나 시장 분석의 다운스트림 모델에서 예측 특성으로 유용한가?
  • RQ4모델이 텍스트에서 선전 서사와 조작을 얼마나 잘 식별하고 분석하는가?
  • RQ5허위정보 분석을 위한 미세조정된 모델의 한계와 정확도 우려는 무엇인가?

주요 결과

  • 미세조정된 Llama 2 모델은 구조화된 출력으로 멀티태스크 텍스트 분석을 수행할 수 있다.
  • 이 접근 방식은 다운스트림 모델에 적합한 감성 포함 명명 엔티티를 추출할 수 있게 한다.
  • PAEFT/LoRA with 4-bit quantization은 작은 데이터 세트에서 비용 효율적인 미세조정을 가능하게 한다.
  • 모델은 우크라이나 및 관련 주제에 관해 서사 분석 및 사실 확인 능력을 시연했다.
  • 질적 평가에 따르면 출력에 일부 부정확성이 있어 더 나은 데이터 세트와 RLHF를 통한 개선이 필요하다는 것을 시사한다.
Figure 2: Time series of tweets for the thematic field ’ukraine nazi’.
Figure 2: Time series of tweets for the thematic field ’ukraine nazi’.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.