Skip to main content
QUICK REVIEW

[논문 리뷰] A Two-Level Classification Approach for Detecting Clickbait Posts using Text-Based Features

Olga Papadopoulou, Markos Zampoglou|arXiv (Cornell University)|2017. 10. 23.
Misinformation and Its Impacts참고 문헌 8인용 수 14
한 줄 요약

이 논문은 65개의 1단계 분류기들을 조합하여 2단계 로지스틱 회귀를 사용하는 두 단계 텍스트 기반 분류 시스템을 제안한다. 클릭베이트 게시물을 탐지하기 위한 것이다. 내부 검증에서 F-스코어 0.63을 달성했지만, 최종 TIRA 평가에서는 F-스코어 0.43으로 성능이 저하되어 일반화 문제와 훈련 데이터에 대한 과적합의 문제를 드러낸다.

ABSTRACT

The emergence of social media as news sources has led to the rise of clickbait posts attempting to attract users to click on article links without informing them on the actual article content. This paper presents our efforts to create a clickbait detector inspired by fake news detection algorithms, and our submission to the Clickbait Challenge 2017. The detector is based almost exclusively on text-based features taken from previous work on clickbait detection, our own work on fake post detection, and features we designed specifically for the challenge. We use a two-level classification approach, combining the outputs of 65 first-level classifiers in a second-level feature vector. We present our exploratory results with individual features and their combinations, taken from the post text and the target article title, as well as feature selection. While our own blind tests with the dataset led to an F-score of 0.63, our final evaluation in the Challenge only achieved an F-score of 0.43. We explore the possible causes of this, and lay out potential future steps to achieve more successful results.

연구 동기 및 목표

  • 소셜 미디어에서 텍스트 기반 특징을 사용하여 클릭베이트 게시물을 자동으로 탐지하는 시스템을 개발하는 것.
  • 가짜 뉴스 탐지에서의 방법을 클릭베이트 탐지 작업에 적용하는 것.
  • 다양한 텍스트 특징을 조합한 두 단계 분류 아키텍처의 효과성을 평가하는 것.
  • 내부 검증과 최종 챌린지 평가 간 성능 격차를 규명하는 것.
  • 기본 텍스트 특징을 초월해 성능을 향상시키는 특징 공학 전략을 탐색하는 것.

제안 방법

  • 시스템은 게시물 텍스트와 대상 기사 제목에서 추출한 다양한 텍스트 기반 특징을 기반으로 훈련된 65개의 1단계 로지스틱 회귀 분류기를 사용한다.
  • 특징으로는 백오브워즈, n-그램, 어휘적, 문법적, 의미적 지표뿐만 아니라 도전 과제에 맞는 고유 특징도 포함된다.
  • 1단계 출력 결과는 하나의 특징 벡터로 연결되어 2단계 로지스틱 회귀 분류기의 입력이 된다.
  • 모든 1단계 모델에 대해 훈련 세트 A에서 10겹 교차검증을 적용하여 외부 검증 예측을 생성한다.
  • 최종 모델은 보류된 테스트 세트(Set C)와 TIRA 평가 플랫폼에서 평가된다.
  • 차원 축소와 모델 성능 향상을 위해 특징 선택 기법이 적용된다.

실험 결과

연구 질문

  • RQ1다양한 텍스트 기반 특징을 조합한 두 단계 분류 접근 방식이 클릭베이트 게시물을 효과적으로 탐지할 수 있는가?
  • RQ2개별 텍스트 특징과 그 조합이 탐지 성능에 미치는 영향은 어떠한가?
  • RQ3왜 모델의 성능이 내부 검증에서 최종 TIRA 평가로 이행할 때 크게 떨어지는가?
  • RQ4게시물 텍스트만을 사용하는 특징이 게시물과 제목 텍스트를 모두 조합한 특징보다 성능이 뛰어나게 되는가?
  • RQ5게시물과 제목 간의 의미적 및 문법적 유사성이 클릭베이트 탐지에 어떤 역할을 하는가?

주요 결과

  • 모델은 65개의 1단계 분류기와 2단계 메타-분류기를 조합하여 내부 검증에서 F-스코어 0.63을 달성했다.
  • 가장 높은 성능을 보인 개별 구성 요소는 게시물 텍스트 전용 특징 세트였으며, F-스코어 0.59를 기록했다.
  • TIRA 플랫폼에서의 최종 평가 결과 F-스코어는 0.43으로 유의미하게 낮아졌으며, 높은 양성 오류 비율을 보였다.
  • 검증과 최종 평가 간 격차는 훈련 세트와 테스트 세트 간 데이터 분포의 변화 또는 과적합의 가능성을 시사한다.
  • 특히 문법적 유사도를 측정하는 특징이 모든 특징 유형 중에서 가장 뛰어난 성능을 보였다.
  • 시각적 또는 미디어 특징을 통합해도 성능 향상이 없었으며, 이는 이 설정에서는 유용성이 제한적임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.