Skip to main content
QUICK REVIEW

[논문 리뷰] Text-based Sentiment Analysis and Music Emotion Recognition

Erion Çano|arXiv (Cornell University)|2018. 06. 06.
Advanced Text Analysis Techniques인용 수 8
한 줄 요약

이 박사학위 논문은 텍스트 기반 감성 분석 및 음악 감정 인식을 위한 딥러닝 프레임워크를 제안하며, 다중 분해능 단어, 이중어 및 삼중어 컨볼루션을 조합한 최적화된 컨volutional 신경망(CNN)과 지역 최대 풀링을 활용한다. 이 접근법은 데이터 부족, 단어 임베딩 선택 및 다양한 길이의 텍스트에 적합한 아키텍처 설계 문제를 해결함으로써 다양한 텍스트 데이터셋에서 최신 기술 수준(SOTA)의 성능을 달성한다.

ABSTRACT

Sentiment polarity of tweets, blog posts or product reviews has become highly attractive and is utilized in recommender systems, market predictions, business intelligence and more. Deep learning techniques are becoming top performers on analyzing such texts. There are however several problems that need to be solved for efficient use of deep neural networks on text mining and text polarity analysis. First, deep neural networks need to be fed with data sets that are big in size as well as properly labeled. Second, there are various uncertainties regarding the use of word embedding vectors: should they be generated from the same data set that is used to train the model or it is better to source them from big and popular collections? Third, to simplify model creation it is convenient to have generic neural network architectures that are effective and can adapt to various texts, encapsulating much of design complexity. This thesis addresses the above problems to provide methodological and practical insights for utilizing neural networks on sentiment analysis of texts and achieving state of the art results. Regarding the first problem, the effectiveness of various crowdsourcing alternatives is explored and two medium-sized and emotion-labeled song data sets are created utilizing social tags. To address the second problem, a series of experiments with large text collections of various contents and domains were conducted, trying word embeddings of various parameters. Regarding the third problem, a series of experiments involving convolution and max-pooling neural layers were conducted. Combining convolutions of words, bigrams, and trigrams with regional max-pooling layers in a couple of stacks produced the best results. The derived architecture achieves competitive performance on sentiment polarity analysis of movie, business and product reviews.

연구 동기 및 목표

  • 감성 분석을 위한 딥러닝에서 데이터 부족 문제를 해결하기 위해 감정 레이블이 부여된 음악 데이터셋을 공동으로 수집하는 방법을 탐색한다.
  • 소규모 데이터셋에서 특히 중요한 도메인 특화 또는 일반적인 사전 훈련된 컬렉션에서의 최적의 단어 임베딩 소싱 전략을 조사한다.
  • 수동으로 커널 및 풀링 설정을 조정할 필요 없이 다양한 길이와 유형의 텍스트에 적응할 수 있는 일반적이고 효과적인 신경망 아키텍처를 설계한다.
  • 운전자의 상태와 감정을 일치시켜 운전자의 편안함을 향상시키는 감정 기반 음악 추천 시스템을 개발한다.
  • 분류 성능 향상을 위해 딥러닝을 전통적인 NLP 특징 및 앙상블 기법과 융합하는 데 있어 방법론적 통찰을 제공한다.

제안 방법

  • 음악 감정 인식에서의 데이터 부족 문제를 해결하기 위해 소셜 미디어 태그를 활용해 두 개의 중간 크기의 감정 레이블이 부여된 음악 데이터셋을 구축했다.
  • 다양한 텍스트 컬렉션에서 훈련된 단어 임베딩을 평가하여 훈련 데이터 크기와 도메인의 임베딩 품질에 미치는 영향을 규명했다.
  • 단어, 이중어 및 삼중어 필터를 갖춘 스택형 컨volutional 신경망을 설계하고, 계층적 의미 패턴을 포착하기 위해 지역 최대 풀링 레이어를 적용했다.
  • 영화 리뷰, 제품 리뷰 및 비즈니스 리뷰 데이터셋에서 체계적인 실험을 통해 아키텍처를 최적화하고 최적의 필터 및 풀링 설정을 규명했다.
  • 가장 높은 성능을 보인 모델을 감정 기반의 음악 추천 시스템에 통합하여 사용자 운전 행동을 감정 프로필에 매핑했다.
  • 문서 세그먼트에 대해 순환 신경망을 적용하거나 전통적 특징과 단어 임베딩을 융합하는 앙상블 전략을 탐색하여 정확도를 향상시켰다.

실험 결과

연구 질문

  • RQ1공동으로 수집한 소셜 태그는 음악 감성 분석을 위한 중간 크기의 감정 레이블이 부여된 데이터셋을 구축하는 데 얼마나 효과적인가?
  • RQ2훈련 데이터가 제한된 상황에서 단어 임베딩의 성능은 훈련 코퍼스의 크기와 도메인에 따라 달라지는가?
  • RQ3다양한 텍스트 유형과 길이에서 감성 분류를 위해 최적의 컨볼루션 및 풀링 레이어 조합은 무엇인가?
  • RQ4다양한 텍스트 입력에 대해 광범위한 초모델 조정 없이도 일반적인 딥러닝 아키텍처가 경쟁적인 성능을 달성할 수 있는가?
  • RQ5특징 수준 또는 결정 수준의 앙상블 기법을 통해 감성 및 감정 인식에서 딥러닝 모델을 어떻게 향상시킬 수 있는가?

주요 결과

  • 더 큰 일반 코퍼스에서 훈련된 단어 임베딩이 소규모 도메인 특화 데이터셋에서 훈련된 것보다 성능이 뛰어나며, 특히 레이블이 부족한 상황에서 더욱 두드러진다.
  • 일반어, 이중어 및 삼중어 필터를 갖춘 스택형 CNN 아키텍처와 지역 최대 풀링을 조합한 모델이 다양한 감성 분석 벤치마크에서 가장 높은 분류 정확도를 달성했다.
  • 제안된 아키텍처는 영화 리뷰, 제품 리뷰 및 비즈니스 리뷰와 같은 다양한 텍스트 유형에 대해 작업별 재구성 없이도 잘 일반화되었다.
  • 단어 임베딩을 전통적인 텍스트 특징(TF-IDF 등)과 융합하거나 문서 세그먼트에 대해 순환 신경망의 예측 결과와 융합함으로써 모델 정확도가 더욱 향상되었다.
  • 감정 기반의 음악 추천 시스템은 운전자의 행동을 감정 프로필에 성공적으로 매핑하여 운전의 편안함과 안전성을 향상시켰다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.