Skip to main content
QUICK REVIEW

[논문 리뷰] We used Neural Networks to Detect Clickbaits: You won't believe what happened Next!

Ankesh Anand, Tanmoy Chakraborty|arXiv (Cornell University)|2016. 12. 05.
Misinformation and Its Impacts참고 문헌 10인용 수 9
한 줄 요약

이 논문은 수작업으로 만든 특징에 의존하지 않고, 사전 훈련된 단어 임베딩과 문자 수준 임베딩을 결합한 양방향 Long Short-Term Memory (BiLSTM) 신경망을 제안한다. 이 모델은 기준 데이터셋에서 98% 정확도, 98% F1 점수, 99% ROC-AUC를 기록하여 이전 최고 성능 모델보다 정확도와 F1 점수에서 5% 이상 뛰어나다.

ABSTRACT

Online content publishers often use catchy headlines for their articles in order to attract users to their websites. These headlines, popularly known as clickbaits, exploit a user's curiosity gap and lure them to click on links that often disappoint them. Existing methods for automatically detecting clickbaits rely on heavy feature engineering and domain knowledge. Here, we introduce a neural network architecture based on Recurrent Neural Networks for detecting clickbaits. Our model relies on distributed word representations learned from a large unannotated corpora, and character embeddings learned via Convolutional Neural Networks. Experimental results on a dataset of news headlines show that our model outperforms existing techniques for clickbait detection with an accuracy of 0.98 with F1-score of 0.98 and ROC-AUC of 0.99.

연구 동기 및 목표

  • 수작업 특징 공학과 도메인 전문 언어 지식에 대한 의존도를 줄이는 딥 러닝 기반 클릭베이트 탐지 시스템을 개발하는 것.
  • 분포형 단어 임베딩과 문자 수준 임베딩을 활용하여 의미, 철자, 형태소 특징을 포괄함으로써 탐지 성능을 향상시키는 것.
  • 표준화된 데이터셋을 사용하여 BiRNN, BiGRU, BiLSTM 등의 다양한 RNN 아키텍처가 클릭베이트 탐지에 어떻게 영향을 미치는지 평가하는 것.
  • 신경망을 통한 엔드 투 엔드 학습이 광범위한 특징 공학에 의존하는 전통적 방법보다 우수한 성능을 낼 수 있음을 보여주는 것.
  • 재현 가능성과 클릭베이트 탐지 연구의 향후 발전을 촉진하기 위해 코드와 모델 가중치를 공개하는 것.

제안 방법

  • Google News 데이터셋에서 1000억 개의 단어를 기반으로 사전 훈련된 300차원 word2vec 임베딩을 사용하여 단어의 의미적 및 문법적 표현을 포착한다.
  • ReLU 활성화 함수와 최대 풀링을 적용한 1차원 합성곱 신경망(CNN)을 문자 시퀀스에 적용하여 문자 수준의 단어 임베딩을 생성함으로써 OOV(Out-of-Vocabulary) 처리를 향상시킨다.
  • 단어 임베딩과 문자 임베딩을 연결(concatenation)하여 양방향 RNN(BiLSTM, BiGRU 또는 BiRNN)의 입력으로 사용하여 헤드라인 내 시퀀스 의존성을 모델링한다.
  • 양방향 LSTM 아키텍처를 사용하여 헤드라인 시퀀스의 전방 및 후방 방향에서의 맥락 정보를 포착한다.
  • 이진 분류(클릭베이트 대 비클릭베이트)를 위해 활성화 함수로 시그모이드를 사용하는 완전 연결 층을 사용하며, 이는 이진 교차 엔트로피 손실과 Adam 옵timizer를 사용해 훈련된다.
  • 정규화를 위해 드롭아웃(rate=0.3)을 적용하고, 배치 크기가 64인 미니배치 경량 최적화를 사용하여 훈련한다.

실험 결과

연구 질문

  • RQ1단어 임베딩과 문자 임베딩을 결합한 신경망 모델이 수작업 특징에 의존하는 전통적 클릭베이트 탐지 방법보다 우수한 성능을 낼 수 있는가?
  • RQ2통합된 단어 및 문자 임베딩을 사용할 때, BiRNN, BiGRU, BiLSTM 중 어떤 RNN 아키텍처가 클릭베이트 탐지에 가장 우수한 성능을 보이는가?
  • RQ3문자 수준 임베딩의 통합이 특히 드문 단어나 OOV 단어에서 일반화 능력을 얼마나 향상시키는가?
  • RQ4표준화된 기준 데이터셋에서 제안된 엔드 투 엔드 딥 러닝 접근법은 정확도, F1 점수, ROC-AUC 측면에서 기존 최고 성능 모델과 어떻게 비교되는가?
  • RQ5모델이 광범위한 언어 전처리나 도메인 전용 어휘집 없이도 높은 성능을 달성할 수 있는가?

주요 결과

  • 문자 임베딩과 단어 임베딩을 모두 사용한 BiLSTM 모델(BiLSTM-CE+WE)이 가장 높은 성능을 기록하여 98% 정확도, 98% F1 점수, 99% ROC-AUC를 달성했다.
  • BiLSTM-CE+WE 모델은 최고의 베이스라인(SVM, Chakraborty 등, 2016)보다 정확도 5.0%p, F1 점수 5.0%p 높게 기록했다.
  • ROC-AUC 점수가 0.99이므로 클릭베이트와 비클릭베이트 헤드라인 간의 구분 능력이 매우 뛰어나다는 것을 시사한다.
  • 단어 임베딩과 문자 임베딩의 조합은 각각 단독으로 사용할 경우보다 일관되게 더 좋은 결과를 낸다. 이는 의미적 특징과 철자적 특징이 상호 보완적임을 보여준다.
  • RNN 변종 중에서 BiLSTM이 BiGRU와 BiRNN보다 뛰어나며, 양방향 아키텍처는 단방향 모델보다 성능 향상이著명하다.
  • 10겹 교차 검증을 통한 성능 평가에서 모델의 성능이 안정적이고 일반화 능력이 뛰어나다는 점을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.