Skip to main content
QUICK REVIEW

[논문 리뷰] Identifying Clickbait Posts on Social Media with an Ensemble of Linear Models

А. В. Григорьев|arXiv (Cornell University)|2017. 10. 01.
Misinformation and Its Impacts참고 문헌 7인용 수 10
한 줄 요약

이 논문은 트윗 내용, 대상 제목, 설명, 메타데이터에서 유래한 텍스트 특징을 활용하여 소셜 미디어에서 클릭베이트 게시물을 탐지하기 위해 선형 서포트 벡터 회귀(SVR) 모델의 앙상블을 제안한다. 이 방법은 Clickbait Challenge 2017에서 테스트 MSE 0.0362를 기록하여 3위를 차지했으며, 특징 중요도 분석을 통해 'shocker'와 'wat'과 같은 언어적 신호가 클릭베이트 행동의 강력한 지표임을 확인하였다.

ABSTRACT

The purpose of a clickbait is to make a link so appealing that people click on it. However, the content of such articles is often not related to the title, shows poor quality, and at the end leaves the reader unsatisfied. To help the readers, the organizers of the clickbait challenge (http://www.clickbait-challenge.org/) asked the participants to build a machine learning model for scoring articles with respect to their "clickbaitness". In this paper we propose to solve the clickbait problem with an ensemble of Linear SVM models, and our approach was tested successfully in the challenge: it showed great performance of 0.036 MSE and ranked 3rd among all the solutions to the contest.

연구 동기 및 목표

  • 소셜 미디어 게시물의 '클릭베이트성' 점수를 정확하게 예측할 수 있는 기계학습 모델을 개발하는 것.
  • 호기심을 악용해 유저를 유도하는 오락실 또는 저질 콘텐츠 문제를 해결하는 것.
  • 트위터와 같은 플랫폼에서 클릭베이트 콘텐츠를 식별하고 잠재적으로 걸러내어 독자 경험을 향상시키는 것.
  • 확장 가능하고 해석이 가능한 선형 모델의 앙상블을 사용하여 공개 챌린지에서 높은 성능을 달성하는 것.

제안 방법

  • postText, targetTitle, targetDescription, targetKeywords, targetParagraphs, targetCaptions 등의 다양한 텍스트 특징에 대해 개별 선형 SVR 모델을 학습시켰다.
  • 평균 클릭베이트성 예측과 표준편차 추정에 대해 5겹 교차검증을 수행하여 모델 성능을 평가했다.
  • 외부 페이스북 데이터를 기반으로 이진 SVM 분류기를 적용하여 앙상블의 추가 특징을 생성했다.
  • 일반화 성능을 향상시키기 위해 개별 모델 출력을 스태킹 기법을 사용하여 ExtraTreeRegressor를 메타-러닝 기반으로 조합했다.
  • 검증 성능을 기반으로 최고의 성능을 보인 앙상블 구성 요소를 선별하였으며, 단순성과 재현 가능성을 우선시했다.
  • ExtraTree 모델의 특징 중요도 분석을 통해 예측에 가장 기여한 입력 특징을 해석하였다.

실험 결과

연구 질문

  • RQ1간단한 선형 모델 앙상블이 소셜 미디어 게시물의 클릭베이트 정도를 효과적으로 예측할 수 있는가?
  • RQ2게시물 내용, 대상 제목, 메타데이터 등 텍스트 특징 중 어떤 것이 클릭베이트 행동과 가장 강하게 상관되는가?
  • RQ3여러 개의 선형 모델 예측을 조합함으로써 개별 모델 대비 성능 향상이 얼마나 이루어지는가?
  • RQ4유사 플랫폼(예: 페이스북)의 외부 데이터를 사용하면 전이학습 환경에서 클릭베이트 탐지 성능에 얼마나 기여하는가?
  • RQ5어떤 언어적 패턴이나 토큰이 클릭베이트를 가장 잘 나타내며, 이를 모델 계수를 통해 식별할 수 있는가?

주요 결과

  • 앙상블 모델은 테스트 평균제곱오차(MSE) 0.0362를 기록하여 Clickbait Challenge 2017에서 5개 팀 중 3위를 차지하였다.
  • postText 특징만을 사용한 모델이 개별 모델 중 가장 뛰어난 성능을 보였으며, 교차검증에서 MSE 0.039를 기록하였다.
  • 표준편차 예측을 포함함으로써 모델의 강건성이 향상되었으며, 최종 앙상블는 평균 및 표준편차 특징을 사용한 결과, 추가로 페이스북 데이터를 통합한 모델보다 우수한 성능을 보였다.
  • 특징 중요도 분석 결과, 'shocker', 'wat', 'n'(숫자를 의미하는 토큰)과 같은 토큰이 클릭베이트 성향에 대해 가장 강력한 양의 예측 변수로 확인되었다.
  • 최고의 성능을 보인 모델는 개별 LinearSVR 모델의 평균 및 표준편차 예측 결과만을 사용하였으며, 이는 이 작업에서 단순성과 특징 공학이 복잡성보다 더 중요함을 시사한다.
  • 모델의 계수 분석을 통해 'you won't believe', 'shocker', 'whoa'와 같은 언어적 신호가 클릭베이트를 유도하는 강력한 지표임을 확인하였으며, 이는 호기심을 자극하는 역할을 한다는 점을 뒷받침한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.