Skip to main content
QUICK REVIEW

[논문 리뷰] Clickbait Identification using Neural Networks

Philippe Thomas|arXiv (Cornell University)|2017. 10. 24.
Misinformation and Its Impacts참고 문헌 16인용 수 14
한 줄 요약

이 논문은 언어적 전처리 없이 텍스트 콘텐츠, 게시 시간, 메타데이터 등의 다중 데이터 소스를 융합하는 신경망 기반 클릭베이트 감지 시스템을 제시한다. 최종 모델은 평균 제곱 오차(MSE) 0.0428을 기록하여 2017년 클릭베이트 감지 챌린지에서 6위를 차지하였다.

ABSTRACT

This paper presents the results of our participation in the Clickbait Detection Challenge 2017. The system relies on a fusion of neural networks, incorporating different types of available informations. It does not require any linguistic preprocessing, and hence generalizes more easily to new domains and languages. The final combined model achieves a mean squared error of 0.0428, an accuracy of 0.826, and a F1 score of 0.564. According to the official evaluation metric the system ranked 6th of the 13 participating teams.

연구 동기 및 목표

  • 소셜 미디어 콘텐츠 내 클릭베이트 헤드라인을 탐지하는 문제를 해결한다.
  • 도메인 특화된 언어적 전처리에 의존하지 않는 강건하고 일반화 가능한 모델을 개발한다.
  • 텍스트, 시간, 메타데이터 등의 다중 데이터 소스 융합을 통해 예측 성능을 향상시킨다.
  • 인간이 평가한 점수를 기반으로 한 회귀 기반 클릭베이트 감지 작업에서 높은 성능을 달성한다.

제안 방법

  • 텍스트 데이터(Post-text, target-title, 문단, 설명)에 대해 무작위로 초기화된 100차원 벡터를 사용한 단어 임베딩을 적용한다.
  • 배치 정규화와 드롭아웃을 적용한 양방향 장기 기억 신경망(LSTM)을 통해 텍스트를 처리하여 정규화를 도모한다.
  • 게시 시간을 시간대별로 구간화하고 원핫 인코딩한 후, 학습된 임베딩을 통해 인코딩한다.
  • 개별 신경망의 밀집 출력층을 연결하여 융합한 후 최종 완전 연결층을 통과시킨다.
  • 체계적인 하이퍼파rameter 튜닝 없이 RMSProp을 사용하여 모델을 훈련하고 조기 종료 및 적응형 학습률을 적용한다.
  • 데이터 증강을 통한 소형 CNN을 활용한 이미지 특징 통합을 탐색하였지만 성능이 열악하여, 향후 작업은 ImageNet 모델에서 전이 학습을 활용할 계획이다.

실험 결과

연구 질문

  • RQ1언어적 전처리 없이 원시 텍스트와 메타데이터만을 사용하여 신경망 모델이 클릭베이트 헤드라인을 효과적으로 탐지할 수 있는가?
  • RQ2텍스트, 시간, 메타데이터 등의 다중 입력 소스 융합이 개별 소스 대비 클릭베이트 감지 성능을 얼마나 향상시키는가?
  • RQ3이미지 특징은 클릭베이트 감지에 어느 정도 기여할 수 있으며, 제한된 이미지 데이터에서 효과적인 학습 전략은 무엇인가?
  • RQ4언어적 전처리 없이도 모델의 일반화 능력은 다양한 도메인과 언어 간에 얼마나 유지되는가?

주요 결과

  • Post-text만으로도 가장 낮은 평균 제곱 오차(MSE) 0.055를 기록하여 가장 정보량이 많은 특징 소스임을 확인하였다.
  • 다양한 신경망을 융합함으로써 내부 평가 세트에서 최고 개별 모델 대비 MSE를 18% 감소시켰다(0.055 → 0.045).
  • 최종 통합 모델은 테스트 세트에서 MSE 0.0428, 정확도 0.826, F₁ 점수 0.564를 기록하였다.
  • 공식 클릭베이트 감지 챌린지 2017에서 13개 팀 중 6위를 기록하여 강건성과 뛰어난 일반화 능력을 입증하였다.
  • 초기 이미지에 소형 CNN을 적용한 결과 무작위 성능을 보였으며, 효과적인 이미지 특징 추출을 위해서는 사전 학습된 ImageNet 모델에서 전이 학습이 필요하다는 점을 시사하였다.
  • 공식 테스트 세트에서의 성능(MSE 0.0428)이 내부 평가 성능(MSE 0.045)과 유사하여 데이터 泄露나 과적합이 발생하지 않았음을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.