Skip to main content
QUICK REVIEW

[논문 리뷰] Clickbait in YouTube Prevention, Detection and Analysis of the Bait using Ensemble Learning

Peya Mowar, Mini Jain|arXiv (Cornell University)|2021. 12. 16.
Misinformation and Its Impacts인용 수 9
한 줄 요약

이 논문은 유튜브 클릭베이트 검출을 위한 새로운 앙상블 학습 모델을 제안하며, 영상 콘텐츠, 제목, 썸네일 분석을 통합하여 6개의 기본 모델과 메타-학습자를 사용하는 스태킹 분류기를 활용한다. 이 방법은 사용자 상호작용 메타데이터를 사용하지 않고 BollyBAIT 데이터셋에서 92.89%의 정확도와 Misleading Video Dataset에서 95.38%의 정확도를 달성하여 업로드 이전 검출이 가능하게 하여 클릭베이트 콘텐츠가 게시되는 것을 방지한다.

ABSTRACT

Unscrupulous content creators on YouTube employ deceptive techniques such as spam and clickbait to reach a broad audience and trick users into clicking on their videos to increase their advertisement revenue. Clickbait detection on YouTube requires an in depth examination and analysis of the intricate relationship between the video content and video descriptors title and thumbnail. However, the current solutions are mostly centred around the study of video descriptors and other metadata such as likes, tags, comments, etc and fail to utilize the video content, both video and audio. Therefore, we introduce a novel model to detect clickbaits on YouTube that consider the relationship between video content and title or thumbnail. The proposed model consists of a stacking classifier framework composed of six base models (K Nearest Neighbours, Support Vector Machine, XGBoost, Naive Bayes, Logistic Regression, and Multilayer Perceptron) and a meta classifier. The developed clickbait detection model achieved a high accuracy of 92.89% for the novel BollyBAIT dataset and 95.38% for Misleading Video Dataset. Additionally, the stated classifier does not use meta features or other statistics dependent on user interaction with the video (the number of likes, followers, or comments) for classification, and thus, can be used to detect potential clickbait videos before they are uploaded, thereby preventing the nuisance of clickbaits altogether and improving the users streaming experience.

연구 동기 및 목표

  • 광고 수익을 위해 사용자 참여를 조작하는 기만적인 클릭베이트 콘텐츠가 증가하는 문제를 해결하기 위해.
  • 영상의 시각적 및 청각-영상 콘텐츠와 함께 제목 및 썸네일과 같은 텍스트 기반 기술자료를 활용하는 검출 시스템을 개발하기 위해.
  • 분류 과정에서 사용자 상호작용 메타데이터(예: 좋아요, 댓글, 팔로워 수)에 의존하지 않도록 하여 영상 업로드 이전에 사전 검출이 가능하도록 하기 위해.
  • 사용자 스트리밍 경험을 향상시키기 위해 잘못된 정보를 담은 콘텐츠가 게시되는 것을 방지하기 위해.

제안 방법

  • 제안된 모델는 K-최근접 이웃, 서포트 벡터 머신, XGBoost, 나이브 베이즈, 로지스틱 회귀, 다층 퍼셉트론의 6개의 기본 모델을 사용하는 스태킹 앙상블 분류기를 활용한다.
  • 영상 콘텐츠는 시각적(프레임) 및 청각적(음성 및 소리) 모odalities에서의 특징 추출을 통해 다중 모odal 특징을 포착한다.
  • 영상 제목과 썸네일의 텍스트 기반 특징은 TF-IDF 및 워드 임베딩을 포함한 NLP 기법을 사용하여 추출된다.
  • 기본 모델들은 영상, 청각, 텍스트 데이터를 조합한 다중 모달 특징을 기반으로 훈련되며, 그 예측 결과는 메타-분류기의 입력으로 사용된다.
  • 메타-분류기는 기본 모델들의 예측을 학습하여 전체 검출 성능를 향상시킨다.
  • 모델은 사용자 상호작용 통계 자료를 사용하지 않고, BollyBAIT와 Misleading Video Dataset이라는 두 개의 새로운 데이터셋에서 훈련 및 평가된다.

실험 결과

연구 질문

  • RQ1영상, 청각, 제목, 썸네일 특징을 조합하여 다중 모달 앙상블 모델이 효과적으로 유튜브 클릭베이트 콘텐츠를 검출할 수 있는가?
  • RQ2개별 모델과 비교해 볼 때, 앙상블 스태킹 분류기의 성능은 기만적인 유튜브 콘텐츠 검출에서 어떻게 다른가?
  • RQ3사용자 참여 지표에 의존하지 않고도 콘텐츠 및 기술자료 특징만으로 영상 업로드 이전에 클릭베이트 검출을 얼마나 잘 수행할 수 있는가?
  • RQ4영상 및 청각 콘텐츠 통합이 메타데이터만을 사용하는 모델에 비해 클릭베이트 검출 정확도를 얼마나 향상시키는가?

주요 결과

  • 제안된 앙상블 모델은 클릭베이트 검출을 위해 특별히 설계된 새로운 데이터셋인 BollyBAIT에서 92.89%의 검출 정확도를 달성하였다.
  • Misleading Video Dataset에서는 더 높은 정확도인 95.38%를 기록하여 다양한 유형의 기만적 콘텐츠에 대한 강력한 일반화 능력을 보였다.
  • 모델은 좋아요, 댓글, 팔로워 수와 같은 사용자 상호작용 기반 특징을 전혀 사용하지 않아 영상 게시 이전의 검출이 가능하다.
  • 영상 및 청각 콘텐츠를 텍스트 기반 기술자료와 통합함으로써 메타데이터 중심 접근법에 비해 검출 성능이 크게 향상되었다.
  • 스태킹 앙상블 아키텍처는 개별 기본 모델보다 우수한 성능을 보이며 다양한 학습 알고리즘을 조합하는 것이 효과적임을 확인하였다.
  • 업로드 이전 클릭베이트 검출 기능은 사용자가 오해의 콘텐츠에 노출되는 것을 줄이는 사전 대응 솔루션을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.