Skip to main content
QUICK REVIEW

[논문 리뷰] Using Neural Network for Identifying Clickbaits in Online News Media

Amin Omidvar, Hui Jiang|arXiv (Cornell University)|2018. 06. 20.
Misinformation and Its Impacts참고 문헌 16인용 수 5
한 줄 요약

이 논문은 뉴스 게시물 텍스트에서 텍스트 표현을 자동으로 학습하는 양방향 GRU 기반 신경망 모델을 제안하며, 클릭베이트 헤드라인을 탐지하는 데 성공적으로 활용되어 Clickbait Challenge 2017에서 평균 제곱오차가 0.0315로 1등을 차지했으며, 특징 공학 또는 외부 데이터 소스에 의존하지 않고도 다른 모델들을 능가함.

ABSTRACT

Online news media sometimes use misleading headlines to lure users to open the news article. These catchy headlines that attract users but disappointed them at the end, are called Clickbaits. Because of the importance of automatic clickbait detection in online medias, lots of machine learning methods were proposed and employed to find the clickbait headlines. In this research, a model using deep learning methods is proposed to find the clickbaits in Clickbait Challenge 2017's dataset. The proposed model gained the first rank in the Clickbait Challenge 2017 in terms of Mean Squared Error. Also, data analytics and visualization techniques are employed to explore and discover the provided dataset to get more insight from the data.

연구 동기 및 목표

  • 온라인 뉴스 헤드라인에서 클릭베이트를 자동으로 탐지하기 위한 엔드 투 엔드 딥 러닝 모델을 개발하는 것.
  • 클릭베이트 예측에 있어 postText, targetTitle, targetDescription 중 가장 유informative한 텍스트 특징를 식별하는 것.
  • 외부 데이터 없이도 원시 텍스트 입력만으로 Clickbait Challenge 2017에서 기존 모델들을 능가하는 것.
  • 다중 클래스 애너테이션 분포가 아닌 이진 클릭베이트 확률 예측으로 분류 작업을 단순화하는 것.

제안 방법

  • 양방향 게이팅 순환 단위(GRU) 네트워크가 입력 텍스트를 정방향과 역방향으로 처리하여 문맥적 종속성을 포착함.
  • 100차원의 사전 학습된 GloVe 벡터로 초기화된 워드 임베딩을 입력 토큰을 표현하는 데 사용함.
  • 정방향 및 역방향 GRU의 최종 은닉 상태를 연결하여 각 시퀀스당 256차원의 컨텍스트 벡터를 형성함.
  • 시그모이드 활성화 함수를 사용하는 단일 레이어 퍼셉트론이 최종 클릭베이트 확률 점수를 계산함.
  • 과적합을 방지하기 위해 드롭아웃 Regularization(임bedding에 0.2, GRU 입력에 0.2, GRU 출력에 0.5)을 적용함.
  • 배치 크기가 64인 미니배치 경사하강법을 사용하여 모델을 훈련하고, 손실 함수로 평균 제곱오차를 사용함.

실험 결과

연구 질문

  • RQ1클릭베이트 탐지에 있어 가장 분류 능력이 높은 텍스트 필드는 postText, targetTitle, targetDescription 중 어느 것인가?
  • RQ2딥 러닝 모델이 수작업 특징 공학 없이도 클릭베이트 탐지에서 최고 성능을 달성할 수 있는가?
  • RQ3Clickbait Challenge 2017에서 순차 기반 RNN 모델의 성능은 더 복잡한 앙상블 또는 다중 소스 모델과 비교해 어떻게 되는가?
  • RQ4예측 작업을 이진 클릭베이트 확률 추정으로 단순화하면 모델의 효율성과 일반화 능력이 향상되는가?

주요 결과

  • 모델은 Clickbait Challenge 2017에서 평균 제곱오차가 0.03152로 1등을 차지하며, 모든 다른 제출물보다 뛰어난 성능을 보임.
  • 'postText' 필드만으로 훈련한 경우 성능이 가장 우수했으며, 이는 인간 애너테이터에게 가장 관련성이 높은 정보를 담고 있었기 때문임.
  • 100차원의 GloVe 임베딩이 테스트한 다른 임베딩 차원과 비교해 가장 낮은 평균 제곱오차를 기록함.
  • 테스트 세트에서 중앙값 절대오차는 0.122, F1 점수는 0.670, 정밀도는 0.732, 재현율은 0.619를 기록함.
  • 정확도는 85.5%이며 R² 점수는 0.571로 강력한 예측 성능를 나타냄.
  • 모델은 단 1분 10초 만에 실행되어 대회에서 가장 빠른 제출물임.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.