Skip to main content
QUICK REVIEW

[논문 리뷰] Heuristic Feature Selection for Clickbait Detection

Matti Wiegmann, Michael Völske|arXiv (Cornell University)|2018. 02. 04.
Sentiment Analysis and Opinion Mining참고 문헌 3인용 수 3
한 줄 요약

이 논문은 회귀 작업에서 클릭베이트 탐지용 특징 부분집합을 최적화하기 위해 떠나는 많은 특징 선택이라는 히우리스틱 워퍼 방법을 제안한다. 특징 그룹을 반복적으로 제거하고 평균 제곱오차(MSE)를 통해 성능 영향을 측정함으로써, 이 방법은 기준 모델의 성능을 20% 향상시켜 딥러닝 모델을 사용하지 않은 채로 Clickbait Challenge 2017에서 2위를 기록했다.

ABSTRACT

We study feature selection as a means to optimize the baseline clickbait detector employed at the Clickbait Challenge 2017. The challenge's task is to score the "clickbaitiness" of a given Twitter tweet on a scale from 0 (no clickbait) to 1 (strong clickbait). Unlike most other approaches submitted to the challenge, the baseline approach is based on manual feature engineering and does not compete out of the box with many of the deep learning-based approaches. We show that scaling up feature selection efforts to heuristically identify better-performing feature subsets catapults the performance of the baseline classifier to second rank overall, beating 12 other competing approaches and improving over the baseline performance by 20%. This demonstrates that traditional classification approaches can still keep up with deep learning on this task.

연구 동기 및 목표

  • 딥러닝 접근 방식에 비해 성능이 열등한 기준 클릭베이트 회귀 모델의 성능을 향상시키는 것.
  • 기존 필터 및 임bedding 방법이 실패하는 소셜 미디어 데이터의 희박한 특징 문제를 다루는 것.
  • 고차원적이고 희박한 클릭베이트 특징 공간에 효과적인 히우리스틱 워퍼 방법을 개발하는 것.
  • 미래의 공학 특징 설계를 위한 고영향도 특징과 잠재적 특징 상호작용을 식별하는 것.
  • 지능적인 특징 선택을 통해 전통적인 머신러닝 모델이 클릭베이트 탐지에서 딥러닝과 경쟁할 수 있음을 보여주는 것.

제안 방법

  • 이 방법은 떠나는 많은 특징 전략을 사용하여, 반복적으로 특징 그룹을 제거하고 평균 제곱오차(MSE)의 변화를 측정한다.
  • 성능 평가는 릿지 회귀를 기본 모델로 사용하며, MSE는 특징 부분집합 선택을 위한 적합도 함수로 기능한다.
  • 특징 카테고리는 문자 n-그램, 단어 n-그램, 단어 목록 특징, 그리고 단어 수와 구두점 빈도와 같은 공학 특징을 포함한다.
  • 이 방법은 예측 오차에 대한 영향도에 따라 특징을 체계적으로 순위 매기며, 분류에 기여하는 특징, 혼동을 일으키는 특징, 중복되는 특징을 식별한다.
  • 고영향도 특징은 새로운 공학 특징의 제안을 위해 분석되며, 예를 들어 '-ly' 또는 '-ing'으로 끝나는 단어의 수와 같은 특징은 그 분류 능력에 기반하여 제안된다.
  • 이 방법은 Clickbait Challenge 2017 데이터셋에 적용되었으며, 학습용으로 19,538개, 테스트용으로 18,979개의 레이블이 부여된 트윗을 포함한다.

실험 결과

연구 질문

  • RQ1희박하고 회귀 기반의 클릭베이트 탐지 작업에서 표준 필터 방법(예: χ²)에 비해 히우리스틱 워퍼 특징 선택이 우월한가?
  • RQ2어느 특징 카테고리가 클릭베이트성 점수 예측에 가장 크게 기여하는가?
  • RQ3특징 그룹의 반복적 제거를 통해 특징 간 상호작용과 중복 특징을 식별할 수 있는가?
  • RQ4공학 특징은 원시 특징 세트에 비해 모델 성능 향상에 얼마나 기여하는가?
  • RQ5지능적인 특징 선택을 통해 전통적인 머신러닝 모델이 클릭베이트 탐지에서 딥러닝과 경쟁할 수 있는가?

주요 결과

  • 떠나는 많은 특징 선택 방법은 기준 모델의 성능을 평균 제곱오차 기준으로 20% 향상시켜 Clickbait Challenge 2017에서 2위를 기록했다.
  • 공학 특징 중 '시간대'와 '점의 수'가 가장 높은 영향을 미쳤으며, 떠나는 많은 특징 분석에서 각각 점수 4.74와 7.18을 기록했다.
  • '-ly' 또는 '-ing'으로 끝나는 단어의 수'는 개별 n-그램의 높은 분류 능력에 기반해 새로운 공학 특징으로 제안할 만한 유망한 후보로 식별되었다.
  • 문자 수준 특징 중 '@'과 '.'은 각각 점수 0.73과 0.53로 매우 분류 능력이 높았으며, '!'는 0.82로 역시 매우 영향력 있었다.
  • 단어 목록 특징인 '쉬운 단어들'은 강한 긍정적 영향(점수: 2.60)을 미쳤으며, 이는 어휘의 단순성이 클릭베이트의 핵심 지표임을 시사한다.
  • 이 방법은 '@'가 문자 n-그램에서 매우 분류 능력이 높은 반면, 해당하는 단어 수준 특징('멘션 수')은 그렇지 않았다는 점을 성공적으로 식별했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.