Skip to main content
QUICK REVIEW

[논문 리뷰] Identifying Misinformation on YouTube through Transcript Contextual Analysis with Transformer Models

Christos Christodoulou, Nikos Salamanos|arXiv (Cornell University)|2023. 07. 22.
Misinformation and Its ImpactsSocial Sciences인용 수 3
한 줄 요약

이 논문은 비디오 트랜스크립트를 사용하여 YouTube 영상의 가짜 정보를 텍스트 기반으로 탐지하는 시스템을 제안한다. 사전 훈련된 및 소수의 예제로 미세조정된 트랜스포머 모델(예: RoBERTa, ELECTRA, MPNet)을 활용하며, 백신 및 가짜 뉴스 데이터셋에서 높은 성능을 기록한다—F1 > 0.90 및 MCC > 0.81. 특히, YouTube 가짜 과학 콘텐츠 데이터셋에서는 소수의 예제로 미세조정된 모델이 일반적인 미세조정 모델보다 20% 높은 성능을 보이며, 낮은 데이터 환경에서의 강력한 일반화 능력을 입증한다.

ABSTRACT

Misinformation on YouTube is a significant concern, necessitating robust detection strategies. In this paper, we introduce a novel methodology for video classification, focusing on the veracity of the content. We convert the conventional video classification task into a text classification task by leveraging the textual content derived from the video transcripts. We employ advanced machine learning techniques like transfer learning to solve the classification challenge. Our approach incorporates two forms of transfer learning: (a) fine-tuning base transformer models such as BERT, RoBERTa, and ELECTRA, and (b) few-shot learning using sentence-transformers MPNet and RoBERTa-large. We apply the trained models to three datasets: (a) YouTube Vaccine-misinformation related videos, (b) YouTube Pseudoscience videos, and (c) Fake-News dataset (a collection of articles). Including the Fake-News dataset extended the evaluation of our approach beyond YouTube videos. Using these datasets, we evaluated the models distinguishing valid information from misinformation. The fine-tuned models yielded Matthews Correlation Coefficient>0.81, accuracy>0.90, and F1 score>0.90 in two of three datasets. Interestingly, the few-shot models outperformed the fine-tuned ones by 20% in both Accuracy and F1 score for the YouTube Pseudoscience dataset, highlighting the potential utility of this approach -- especially in the context of limited training data.

연구 동기 및 목표

  • 비디오 트랜스크립트만을 사용하여 YouTube에서의 가짜 정보 탐지에 대해 강건하고 확장 가능한 방법을 개발하는 것.
  • 비교적 작은 데이터셋에서 텍스트 기반으로 가짜 정보를 분류하는 데 효과적인 사전 훈련된 트랜스포머 모델(예: BERT, RoBERTa, ELECTRA)과 소수의 예제 학습(예: MPNet, RoBERTa-large)의 유효성을 평가하는 것.
  • 트랜스크립트의 장문 문서 분류 문제를 겹치는 윈도우 전략을 통해 효과적으로 다루는 것.
  • 백신 가짜 정보, 가짜 과학, 가짜 뉴스 기사 등 다양한 유형의 가짜 정보에 대한 모델 성능을 평가하는 것.
  • 재현 가능성과 가짜 정보 탐지 연구 분야의 광범위한 활용을 위해 오픈소스 코드를 제공하는 것.

제안 방법

  • 유튜브 영상의 분류 작업을 영상의 텍스트 트랜스크립트를 추출하고 분석함으로써 텍스트 분류 문제로 전환한다.
  • 사전 훈련된 트랜스포머 모델(BERT, RoBERTa, ELECTRA)을 작업에 맞는 데이터셋에 대해 미세조정함으로써 전이 학습을 적용한다.
  • 문장 임베딩 기반 소수의 예제 학습(예: MPNet, RoBERTa-large)을 활용하여 최소한의 레이블된 데이터로도 높은 성능을 달성한다.
  • 장문의 트랜스크립트를 처리하기 위해 80% 겹침을 가지는 슬라이딩 윈도우 전략을 적용하여 핵심 정보 손실을 방지한다.
  • 공식 $ N = \lceil \frac{L - M}{S} \rceil + 1 $ 를 사용하여 겹치는 윈도우의 수를 결정한다. 여기서 $ L $ 은 문서 길이, $ M $ 은 최대 시퀀스 길이, $ S $ 은 겹침 비율이다.
  • 각 트랜스크립트 윈도우를 분류하고 예측 결과를 집계하여 최종 레이블(가짜 정보 또는 유효한 콘텐츠)을 결정한다.

실험 결과

연구 질문

  • RQ1RQ1: 비디오 트랜스크립트만을 사용하여 가짜 정보 탐지에 대해 사전 훈련된 트랜스포머 모델과 소수의 예제 학습 방식이 얼마나 효과적인가?
  • RQ2RQ2: 이러한 모델의 성능가 다양한 유형의 데이터셋에서 어떻게 달라지는가?
  • RQ3RQ3: 트랜스포머 모델을 활용해 장문의 문서 분류 문제를 어떻게 효과적으로 다룰 수 있는가?
  • RQ4RQ4: 낮은 데이터 환경에서 사전 훈련된 모델과 소수의 예제 학습 모델 간의 성능 비교는 어떠한가?

주요 결과

  • 사전 훈련된 RoBERTa는 유튜브 백신 데이터셋에서 MCC 0.88, 정확도 0.94, F1 점수 0.94를 기록했다.
  • 유튜브 가짜 과학 데이터셋에서 소수의 예제로 미세조정된 MPNet은 모든 사전 훈련된 모델을 초월했으며, F1 점수 0.78, 정확도 0.72를 기록했고, 사전 훈련된 모델 대비 각각 20% 높은 성능을 보였다.
  • 사전 훈련된 ELECTRA는 ISOT 가짜 뉴스 데이터셋에서 가장 높은 성능을 기록했으며, MCC 0.94, 정확도 0.97, F1 점수 0.97를 기록했다.
  • 소수의 예제로 미세조정된 RoBERTa-large는 ISOT 가짜 뉴스 데이터셋에서 F1 점수 0.90, 정확도 0.94를 기록했으며, 소수의 예제 설정에서 MPNet을 능가하는 성능을 보였다.
  • 80% 겹침을 가지는 슬라이딩 윈도우 전략은 장문의 맥락 정보를 효과적으로 유지하여 긴 트랜스크립트의 신뢰할 수 있는 분류를 가능하게 했다.
  • 본 연구는 소수의 예제 학습 방식이 백신 가짜 정보나 가짜 과학 콘텐츠처럼 레이블이 부족한 자원이 제한된 환경에서 특히 효과적임을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.