Skip to main content
QUICK REVIEW

[논문 리뷰] Deep Learning for Digital Text Analytics: Sentiment Analysis

U. Reshma, H B Barathi Ganesh|arXiv (Cornell University)|2018. 04. 10.
Sentiment Analysis and Opinion Mining참고 문헌 9인용 수 7
한 줄 요약

이 논문은 디지털 뉴스 텍스트에서 감성 분석을 위한 딥러닝 접근법을 제안하며, 초기 레이블링에 VADER를 결합하고, 사전 훈련된 GloVe 임베딩을 사용한 컨볼루션 신경망(CNN)을 활용해 뉴스를 긍정 또는 부정으로 분류한다. 이 모델은 훈련 정확도 96%와 내부 및 외부 데이터셋에서 85% 이상의 테스트 정확도를 기록하며, SVM 및 Doc2Vec와 같은 전통적 방법을 능가한다.

ABSTRACT

In today's scenario, imagining a world without negativity is something very unrealistic, as bad NEWS spreads more virally than good ones. Though it seems impractical in real life, this could be implemented by building a system using Machine Learning and Natural Language Processing techniques in identifying the news datum with negative shade and filter them by taking only the news with positive shade (good news) to the end user. In this work, around two lakhs datum have been trained and tested using a combination of rule-based and data driven approaches. VADER along with a filtration method has been used as an annotating tool followed by statistical Machine Learning approach that have used Document Term Matrix (representation) and Support Vector Machine (classification). Deep Learning algorithms then came into picture to make this system reliable (Doc2Vec) which finally ended up with Convolutional Neural Network(CNN) that yielded better results than the other experimented modules. It showed up a training accuracy of 96%, while a test accuracy of (internal and external news datum) above 85% was obtained.

연구 동기 및 목표

  • 자연어 처리와 기계 학습을 활용해 사용자에게 부정 뉴스를 걸러내고 긍정 뉴스만 제공하는 신뢰할 수 있는 시스템을 개발하기 위해.
  • 규칙 기반 감성 분석(VADER)과 기계 학습 모델을 융합해 수동 레이블링 작업을 줄이기 위해.
  • 기존 통계적 방법(DTM-SVM)과 신경망(Doc2Vec)을 초월해 감성 분류 정확도를 향상시키기 위해.
  • 다양한 도메인 특성을 지닌 실제 뉴스 텍스트에서 딥러닝 모델, 특히 CNN의 성능을 평가하기 위해.
  • 내부 및 외부 테스트 데이터에서의 강건성 확보를 위해 사전 훈련된 워드 벡터(GloVe)와 하이퍼파라미터 튜닝을 활용해 모델 일반화 능력을 향상시키기 위해.

제안 방법

  • 약 200,000개의 뉴스 샘플을 감성 극성(긍정/부정)으로 자동 레이블링하기 위해 필터링 방법을 적용한 VADER를 사용하였다.
  • 기본 성능를 평가하기 위해 문서 단어 행렬(DTM) 표현과 서포트 벡터 머신(SVM)을 활용한 통계 기반 기계 학습 파이프라인을 적용하였다.
  • 문서 수준의 분산 표현을 통해 백오브워즈를 초월한 의미적 맥락을 포착하기 위해 Doc2Vec를 활용하였다.
  • 600개 필터, 필터 크기 3, ReLU 활성화 함수, 맥스 풀링, 0.5 드롭아웃을 포함한 컨볼루션 신경망(CNN)을 설계하였다.
  • 입력 표현 향상과 모델 일반화 향상을 위해 사전 훈련된 GloVe 워드 임베딩을 통합하였다.
  • 학습률, 에포크 수(20), 스트라이드(1), 패딩(정확한) 등의 하이퍼파라미터를 최적화하고 GPU를 활용해 효율적으로 훈련하였다.

실험 결과

연구 질문

  • RQ1규칙 기반 감성 점수(VADER)와 딥러닝을 융합한 하이브리드 접근법이 뉴스 텍스트에서 감성 분류 정확도를 향상시킬 수 있는가?
  • RQ2CNN 기반 모델은 뉴스 기사의 감성 분류에서 전통적 방법(DTM-SVM)과 Doc2Vec에 비해 어떻게 비교되는가?
  • RQ3사전 훈련된 GloVe 임베딩을 사용할 경우 뉴스 데이터에서 감성 분류 모델의 성능 향상 정도는 어느 정도인가?
  • RQ4학습 중에 사용되지 않은 외부 뉴스 데이터에 대해 모델이 잘 일반화될 수 있는가?
  • RQ5하이퍼파라미터 튜닝과 드롭아웃 정규화가 모델의 강건성과 테스트 정확도에 미치는 영향은 무엇인가?

주요 결과

  • CNN 모델은 훈련 정확도 96%를 기록하여 훈련 데이터에 대해 강력한 학습 능력을 보였다.
  • 동일한 분포를 가진 테스트 데이터에 대해 내부 테스트 정확도가 85%를 초과하여, 훈련 데이터와 유사한 분포에서의 일반화 능력을 입증하였다.
  • 수동으로 태깅된 외부 뉴스 데이터에서의 외부 테스트 정확도도 85%를 초과하여, 실제 뉴스에 대한 강력한 일반화 능력을 입증하였다.
  • DTM-SVM 및 Doc2Vec 기반 모델보다 CNN 모델이 뛰어난 성능을 보여, 이 작업에 있어 우월성을 확인하였다.
  • 사전 훈련된 GloVe 임베딩 통합으로 입력 표현 향상과 모델 성능 향상이 뚜렷하게 향상되었다.
  • 드롭아웃(0.5) 및 최적의 필터 크기(3)를 포함한 하이퍼파라미터 튜닝이 일반화 능력 향상과 과적합 감소에 기여하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.