Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Robust Heterogeneous Signal Features from Parallel Neural Network for Audio Sentiment Analysis

Feiyang Chen, Ziqian Luo|arXiv (Cornell University)|2018. 11. 20.
Music and Audio Processing참고 문헌 41인용 수 9
한 줄 요약

이 논문은 병렬 CNN-LSTM 신경망 모델인 AFF-ACRNN을 제안하며, 이는 양방향 LSTM과 주의 메커니즘을 통해 스펙트로그램, cepstral, Mel-spectrogram 표현 방식을 포함한 강건한 이질적 음성 특징을 추출한다. 이 모델은 MOSI 데이터셋에서 최신 기술 대비 9.33% 향상된 성능을 기록하여 음성 감성 분석 분야에서 뛰어난 정확도와 일반화 능력을 입증한다.

ABSTRACT

Audio Sentiment Analysis is a popular research area which extends the conventional text-based sentiment analysis to depend on the effectiveness of acoustic features extracted from speech. However, current progress on audio sentiment analysis mainly focuses on extracting homogeneous acoustic features or doesn't fuse heterogeneous features effectively. In this paper, we propose an utterance-based deep neural network model, which has a parallel combination of Convolutional Neural Network (CNN) and Long Short-Term Memory (LSTM) based network, to obtain representative features termed Audio Sentiment Vector (ASV), that can maximally reflect sentiment information in an audio. Specifically, our model is trained by utterance-level labels and ASV can be extracted and fused creatively from two branches. In the CNN model branch, spectrum graphs produced by signals are fed as inputs while in the LSTM model branch, inputs include spectral features and cepstrum coefficient extracted from dependent utterances in audio. Besides, Bidirectional Long Short-Term Memory (BiLSTM) with attention mechanism is used for feature fusion. Extensive experiments have been conducted to show our model can recognize audio sentiment precisely and quickly, and demonstrate our ASV is better than traditional acoustic features or vectors extracted from other deep learning models. Furthermore, experimental results indicate that the proposed model outperforms the state-of-the-art approach by 9.33\% on Multimodal Opinion-level Sentiment Intensity dataset (MOSI) dataset.

연구 동기 및 목표

  • 기존의 음성 감성 분석 방법이 동일한 특징에 의존하거나 이질적 음성 특징의 비효율적 융합에 의존하는 한계를 해결하기 위해.
  • 스펙트럼 및 시간적 신호 표현 방식을 활용하여 발화에서 맥락 의존적 감성 신호를 포착할 수 있는 딥 러닝 모델을 개발하기 위해.
  • 맥락 인식 주의 메커니즘을 사용해 다중 음성 신호 유형에서의 구분 능력 있는 특징을 융합함으로써 감성 분류 정확도를 향상시키기 위해.
  • 다양한 언어적 및 정서적 맥락, 특히 자원이 부족한 언어나 비영어 언어 환경에서도 모델의 강건성을 검증하기 위해.
  • 제안된 음성 감성 벡터(ASV)가 다국어 및 다모odal 환경에서의 일반화 능력을 입증하기 위해.

제안 방법

  • 모델는 스펙트로그램 입력을 처리하는 CNN 브랜치와 발화에서 추출된 cepstral 및 스펙트럼 특징을 처리하는 LSTM 브랜치를 포함한 병렬 아키텍처를 사용한다.
  • Librosa 툴킷을 사용해 네 가지 핵심 이질적 음성 특징—Mel-spectrogram, MFCC, chroma, zero-crossing rate—을 추출하고, 이는 이중 브랜치 네트워크의 입력으로 사용된다.
  • CNN 및 LSTM 브랜치에서 별도로 음성 감성 벡터(ASV)를 생성한다: CNN 브랜치에서 CASV를, LSTM 브랜치에서 LASV를 생성하며, 이는 전역 평균 풀링을 통해 수행된다.
  • 양방향 LSTM(BiLSTM)과 주의 메커니즘을 통해 CASV와 LASV를 융합하여 최종 ASV를 생성하며, 감성 관련 시간 패턴에 중점을 둔다.
  • 발화 수준의 감성 레이블을 사용해 엔드 투 엔드로 모델을 훈련하며, 특징 추출과 분류의 공동 최적화를 수행한다.
  • 주의 메커니즘은 감성에 대한 관련성이 높은 특징 벡터에 대해 동적으로 가중치를 적용하여 구분 능력을 향상시킨다.

실험 결과

연구 질문

  • RQ1병렬 CNN-LSTM 아키텍처가 이질적 음성 특징을 효과적으로 추출하고 융합하여 음성 감성 분류 성능을 향상시킬 수 있는가?
  • RQ2CNN 및 LSTM 브랜치의 주의 기반 융합 방식이 단일 브랜치 또는 비주목 기반 방법에 비해 감성 표현을 어떻게 향상시키는가?
  • RQ3제안된 모델이 중국어, 광둥어, 사천어 등 다양한 언어 및 방언에 대해 얼마나 일반화되는가?
  • RQ4음성 감성 벡터(ASV)가 전통적인 음성 특징 또는 다른 딥 러닝 모델의 벡터에 비해 감성 인식 성능에서 뛰어나게 되는가?
  • RQ5자원이 부족한 언어나 비영어 음성 데이터셋에서 최신 기술 대비 모델의 성능은 어떠한가?

주요 결과

  • 제안된 AFF-ACRNN 모델은 MOSI 데이터셋에서 최신 기술 대비 9.33%의 절대적인 가중 정확도 향상을 기록하여 69.42%의 정확도를 달성하였다.
  • 양방향 LSTM과 주의 메커니즘을 통한 융합은 특징 융합 능력을 크게 향상시키며, 주의 기반 없이 또는 단순한 융합 전략을 사용한 모델보다 뛰어난 성능을 보였다.
  • 모델는 강력한 일반화 능력을 보였으며, 훈련 데이터가 제한된 상황에서도 중국어 테스트 세트에서 68.84%의 정확도와 검증 세트에서 64.08%의 정확도를 기록하였다.
  • SBCNN 브랜치에서 ResNet152와 LSTM 브랜치에서 UB-BiLSTM를 조합한 조합이 가장 뛰어난 성능을 보였으며, MOSI에서 69.42%의 가중 정확도를 기록하였다.
  • MOUD 데이터셋에서도 높은 성능 유지를 유지하여 언어 변형에 대한 강건성과 언어 특수성에 대한 의존도 감소를 입증하였다.
  • 광범위한 추상화 연구를 통해 Mel-spectrogram, MFCC, chroma, zero-crossing rate의 네 가지 특징 조합이 감성 분류에 가장 대표적인 특징으로 확인되었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.