Skip to main content
QUICK REVIEW

[논문 리뷰] $ ho$-hot Lexicon Embedding-based Two-level LSTM for Sentiment Analysis

Ou Wu, Tao Yang|arXiv (Cornell University)|2018. 03. 21.
Sentiment Analysis and Opinion Mining참고 문헌 22인용 수 3
한 줄 요약

이 논문은 노이즈가 많거나 모호한 레이블링이 있는 상황에서도 중국어 감성 분석 성능을 향상시키기 위해 ρ-핫 어휘 임베딩을 갖춘 이중 수준의 LSTM 모델을 제안한다. 순수 감성과 혼합 감성 텍스트를 분리하는 두 단계 레이블링 전략을 도입하고, 극성 어휘, 품사(POS), 접속사와 같은 어휘적 단서를 ρ-핫 인코딩을 통해 통합함으로써, 세 개의 중국어 감성 분석 데이터셋에서 최신 기술(SOTA) 수준의 정확도를 달성하였다. 이는 기존의 딥러닝 및 어휘 기반 접근 방식을 능가한다.

ABSTRACT

Sentiment analysis is a key component in various text mining applications. Numerous sentiment classification techniques, including conventional and deep learning-based methods, have been proposed in the literature. In most existing methods, a high-quality training set is assumed to be given. Nevertheless, constructing a high-quality training set that consists of highly accurate labels is challenging in real applications. This difficulty stems from the fact that text samples usually contain complex sentiment representations, and their annotation is subjective. We address this challenge in this study by leveraging a new labeling strategy and utilizing a two-level long short-term memory network to construct a sentiment classifier. Lexical cues are useful for sentiment analysis, and they have been utilized in conventional studies. For example, polar and privative words play important roles in sentiment analysis. A new encoding strategy, that is, $ ho$-hot encoding, is proposed to alleviate the drawbacks of one-hot encoding and thus effectively incorporate useful lexical cues. We compile three Chinese data sets on the basis of our label strategy and proposed methodology. Experiments on the three data sets demonstrate that the proposed method outperforms state-of-the-art algorithms.

연구 동기 및 목표

  • 감성 분석을 위한 고품질 훈련 데이터를 구축하는 데 도전하는 데 기여하기 위해 주관적이고 복잡한 감성 레이블링 문제를 해결하고자 한다.
  • 극성 어휘, 품사(POS), 접속사와 같은 어휘적 단서를 활용하여 감성 분류 성능을 향상시키고자 한다.
  • 순수 감성과 혼합 감성 텍스트를 분리하는 새로운 이중 단계 레이블링 전략을 개발하여 보다 효과적인 모델 훈련을 가능하게 하고자 한다.
  • 기존의 one-hot 인코딩 대신 ρ-핫 인코딩을 도입하여 감성 분석에서 어휘적 특징을 보다 우수하게 포착하는 데 목적이 있다.
  • 순수 감성 대비 혼합 감성이라는 두 가지 다른 레이블링 데이터 분포에서 동시에 표현을 학습하고 분류 성능을 향상시키기 위해 이중 수준의 LSTM 아키텍처를 설계하고자 한다.

제안 방법

  • 이중 단계 레이블링 전략을 도입: 첫 번째 단계에서는 대규모 텍스트 집합을 순수 감성 성향(각 샘플당 하나의 레이블)으로 레이블링하고, 두 번째 단계에서는 다수의 레이블러가 혼합 감성 텍스트를 레이블링하여 모호성을 반영한다.
  • 이중 수준의 LSTM 네트워크를 제안하여 계층적 감성 표현을 모델링함: 첫 번째 레벨은 순수 감성 문장을 인코딩하고, 두 번째 레벨은 혼합 감성 문맥을 통합한다.
  • 어휘 임베딩을 사용하여 모델에 언어학적 지식을 통합함: 극성 어휘, 품사 태그, 접속사 어휘를 학습 가능한 특징으로 인코딩한다.
  • one-hot 인코딩의 대안으로 ρ-핫 인코딩을 도입하여, 여러 관련 어휘(예: 감성 단서)를 동시에 가중치 기반 기여도로 인코딩할 수 있도록 한다.
  • 다른 어휘적 단서(극성 어휘, POS, 접속사)에 대해 별도의 임베딩 레이어를 사용하고, 이를 연결하여 이중 수준의 LSTM에 공통 표현 학습을 위한 입력으로 제공한다.
  • 모델은 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 훈련되며, ρ-핫 인코딩의 ρ 및 n와 같은 하이퍼파라미터는 그리드 서치를 통해 최적화된다.

실험 결과

연구 질문

  • RQ1순수 감성과 혼합 감성 텍스트를 분리하는 이중 단계 레이블링 전략이 감성 분류를 위한 훈련 데이터의 품질과 활용도를 향상시키는가?
  • RQ2어휘적 단서(극성 어휘, 품사, 접속사)를 어휘 임베딩을 통해 통합하면 딥러닝 모델의 감성 분석 성능이 향상되는가?
  • RQ3ρ-핫 인코딩이 기존 one-hot 인코딩보다 텍스트 내 의미적 및 감성 관련 특징을 더 잘 포착할 수 있는가?
  • RQ4이중 수준의 LSTM 아키텍처가 순수 감성 대비 혼합 감성이라는 두 가지 다른 데이터 분포에서 계층적 감성 표현을 효과적으로 학습하는가?
  • RQ5다양한 구성 요소(예: 극성 어휘, 품사, 접속사)가 최종 분류 정확도에 기여하는 정도는 어느 정도인가?

주요 결과

  • 제안된 ρTl-LSTM 모델은 세 개의 중국어 감성 분석 데이터셋에서 모두 최고의 정확도를 기록하여 최신 기술(SOTA)을 달성하였다.
  • 어휘 임베딩에 모든 극성 어휘를 사용할 경우, 극성 어휘 없이 사용한 경우 대비 정확도가 최대 4.7% 향상되었으며, 호텔 데이터셋에서 최고 정확도 0.837을 기록하였다.
  • 어휘 임베딩에 품사 단서를 통합할 경우, 품사 정보가 없는 모델 대비 정확도가 최대 1.5% 향상되었으며, 호텔 코퍼스에서 최고 성능 0.837을 기록하였다.
  • 접속사 어휘 임베딩을 추가로 통합할 경우 정확도가 더욱 향상되었으며, 모바일 코퍼스에서 모든 접속사를 사용한 경우 최고 성능 0.841을 기록하였다.
  • ρTl-LSTM-W 모델은 모바일 데이터셋에서 최고 정확도 0.841을 기록하였고, ρTl-LSTM-C는 호텔 데이터셋에서 0.837을 달성하여 다양한 데이터셋에서 일관된 우수성을 입증하였다.
  • ρ-핫 인코딩의 최적 ρ 값은 5~10으로 확인되었으며, 호텔 데이터셋에서 ρ=5일 때 최고 정확도 0.837을 기록하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.