Skip to main content
QUICK REVIEW

[논문 리뷰] Generating Word and Document Embeddings for Sentiment Analysis

Cem Rıfkı Aydın, Tunga Güngör|arXiv (Cornell University)|2020. 01. 05.
Sentiment Analysis and Opinion Mining인용 수 5
한 줄 요약

이 논문은 문맥, 감성 지도 학습, 사전 기반 특징을 결합하여 터키어 및 영어 데이터셋에서 감성 분류 성능을 크게 향상시키는 새로운 방법을 제안한다. 이 방법은 word2vec 및 이전의 터키어 감성 분석 방법을 포함한 베이스라인 모델을 능가하며, 터키어 영화 리뷰에서 90% 이상, 영어 트위터 데이터에서 약 88%의 정확도를 기록하여 최신 기술 수준(SOTA) 성능을 달성한다. SVM 분류기를 사용한다.

ABSTRACT

Sentiments of words differ from one corpus to another. Inducing general sentiment lexicons for languages and using them cannot, in general, produce meaningful results for different domains. In this paper, we combine contextual and supervised information with the general semantic representations of words occurring in the dictionary. Contexts of words help us capture the domain-specific information and supervised scores of words are indicative of the polarities of those words. When we combine supervised features of words with the features extracted from their dictionary definitions, we observe an increase in the success rates. We try out the combinations of contextual, supervised, and dictionary-based approaches, and generate original vectors. We also combine the word2vec approach with hand-crafted features. We induce domain-specific sentimental vectors for two corpora, which are the movie domain and the Twitter datasets in Turkish. When we thereafter generate document vectors and employ the support vector machines method utilising those vectors, our approaches perform better than the baseline studies for Turkish with a significant margin. We evaluated our models on two English corpora as well and these also outperformed the word2vec approach. It shows that our approaches are cross-domain and portable to other languages.

연구 동기 및 목표

  • 일반적인 단어 임베딩이 터키어와 같이 자원이 적은 언어의 도메인 특화 감성 극성(positive/negative)을 포착하는 데에 한계가 있음을 해결하기 위해.
  • 감성 점수 지도 학습과 어휘 및 의미적 특징을 사전 및 문맥에서 통합하여 감성 분류 성능을 향상시키기 위해.
  • 다양한 도메인과 언어에서 효과적인 포괄적이고 이식 가능한 단어 및 문서 임베딩을 개발하기 위해.
  • 기존의 머신러닝 모델인 SVM이 감성 강화된 고품질 임베딩과 함께 사용될 경우 딥러닝 모델을 능가할 수 있음을 보여주기 위해.
  • 감성 인식 임베딩을 다른 자연어 처리 작업(감성 분석을 초과)에 적용 가능한 공개 프레임워크를 제공하기 위해.

제안 방법

  • 대규모 코퍼스에서 훈련된 word2vec 임베딩에 리뷰 수준의 감성 점수(예: 별점 평가)에서 유도된 수작업 특징을 결합하여 감성 강화된 단어 벡터를 생성한다.
  • 공식 터키어 사전(TDK)에서 유래한 사전 기반 특징을 통합하여 의미적 및 문법적 표현에 어휘 지식을 강화한다.
  • 감성 극성(긍정, 부정, 중립)에 대한 지도 학습 점수를 문맥 및 사전 기반 특징과 융합하기 위해 가중치 파라미터 p를 사용하는 전략적 융합 방법을 적용하며, 도메인 특화 감성에 최적화한다.
  • 강화된 단어 벡터의 평균 또는 풀링을 통해 문서 수준의 임베딩을 구성하여 문서 수준의 감성 인식 표현을 유지한다.
  • 감성 분류를 위해 서포트 벡터 머신(SVM) 분류기를 사용하며, 입력 임베딩의 품질이 높기 때문에 신경망보다 성능이 뛰어나다.
  • 코사인 유사도를 사용하여 단어 벡터의 의미적 특성을 정성적으로 평가하며, 감성 관련 단어들이 같은 극성의 단어들과 군집되어 있음을 확인한다.

실험 결과

연구 질문

  • RQ1감성 지도 학습 점수를 문맥 및 사전 기반 특징과 융합하면, 자원이 적은 언어인 터키어와 같은 환경에서 감성 분류를 위한 단어 임베딩 성능이 향상되는가?
  • RQ2도메인 특화 감성 정보의 통합은 감성 분석 작업에서 단어 및 문서 임베딩의 성능에 어떤 영향을 미치는가?
  • RQ3감성 강화된 임베딩을 사용할 경우, 비신경망 기반의 기존 머신러닝 모델인 SVM이 얼마나 높은 성능을 낼 수 있는가?
  • RQ4제안된 방법은 영어 및 다양한 텍스트 유형(예: 영화 리뷰, 소셜 미디어)을 포함한 언어 및 도메인 간으로 일반화 가능한가?
  • RQ5감성 인식 임베딩은 표준 word2vec 및 기타 기준 모델에 비해 감성 관련 의미 관계를 얼마나 잘 포착하는가?

주요 결과

  • 제안된 방법은 터키어 영화 리뷰 데이터셋에서 90% 이상의 정확도를 기록하였으며, 이는 이전 연구의 기준 방법보다 유의미한 향상(유의수준 p < 0.05)을 보였다.
  • 영어 트위터 데이터셋에서는 약 88%의 정확도를 달성하였으며, 원거리 지도 학습이나 이모티콘 기반 특징에 의존하는 최신 기술 수준의 모델들을 능가하였다.
  • TDK 사전 기반 특징과 3-특징(지도 학습) 접근 방식의 조합이 가장 높은 성능 향상을 이끌었으며, 특히 문맥 정보가 풍부한 영화 리뷰 도메인에서 두드러졌다.
  • 코퍼스 기반 접근 방식(공개된 감성 레이블 없이 공생 패턴만 사용)도 표준 word2vec을 능가했으며, 감성 포착에 문맥의 가치가 있음을 입증했다.
  • 정성적 분석을 통해 감성 인식 임베딩이 코사인 유사도를 통해 같은 극성의 단어들(예: 'muhteşem'과 '10/10', 'harika')을 정확히 군집화하고 있음을 확인했다.
  • SVM 분류기는 일관되게 컨볼루션 신경망(CNNs)보다 성능이 뛰어나, 고품질의 임베딩이 깊이 있는 신경망의 복잡성 부족을 상쇄할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.