Skip to main content
QUICK REVIEW

[논문 리뷰] ConcealNet: An End-to-end Neural Network for Packet Loss Concealment in Deep Speech Emotion Recognition

Mostafa M. Mohamed, Björn W. Schuller|arXiv (Cornell University)|2020. 05. 15.
Speech and Audio Processing참고 문헌 36인용 수 11
한 줄 요약

ConcealNet는 반복 구조에 직접 통합된 마스크 인식 메커니즘을 갖춘 생성 셀을 사용하여 패킷 손실 음성 회복(PLC)을 딥 음성 정서 인식(SER)에 통합하는 엔드 투 엔드 신경망이다. 짧은 손실 빈도가 높은 상황에서도 음성 복원 및 정서 예측 성능을 크게 향상시키며, 양방향 및 스트레스 훈련 버전이 0-치환 및 보간과 같은 기존 기준보다 뛰어난 성능을 보인다.

ABSTRACT

Packet loss is a common problem in data transmission, including speech data transmission. This may affect a wide range of applications that stream audio data, like streaming applications or speech emotion recognition (SER). Packet Loss Concealment (PLC) is any technique of facing packet loss. Simple PLC baselines are 0-substitution or linear interpolation. In this paper, we present a concealment wrapper, which can be used with stacked recurrent neural cells. The concealment cell can provide a recurrent neural network (ConcealNet), that performs real-time step-wise end-to-end PLC at inference time. Additionally, extending this with an end-to-end emotion prediction neural network provides a network that performs SER from audio with lost frames, end-to-end. The proposed model is compared against the fore-mentioned baselines. Additionally, a bidirectional variant with better performance is utilised. For evaluation, we chose the public RECOLA dataset given its long audio tracks with continuous emotion labels. ConcealNet is evaluated on the reconstruction of the audio and the quality of corresponding emotions predicted after that. The proposed ConcealNet model has shown considerable improvement, for both audio reconstruction and the corresponding emotion prediction, in environments that do not have losses with long duration, even when the losses occur frequently.

연구 동기 및 목표

  • 패킷 손실으로 인해 모델 성능이 저하되는 음성 정서 인식(SER) 분야에서 엔드 투 엔드 PLC 솔루션의 부족을 해결하기 위해.
  • 반복 아키텍처 내에서 실시간으로 단계별로 PLC를 수행할 수 있는 신경망을 개발하여 SER 파이프라인에 원활하게 통합되도록 하기 위해.
  • 새로운 스트레스 훈련 기법을 통해 장시간 손실에 대한 강건성을 향상시키기 위해.
  • 지속적인 정서 애너테이션을 가진 RECOLA 데이터셋을 사용하여 PLC의 SER 성능에 미치는 영향을 평가하기 위해.

제안 방법

  • 스택드 LSTM로 구현된 반복 생성 셀 $ R $ 은 손실된 프레임를 식별하는 이진 마스크 $ M_t $ 를 사용하는 음성 회복 기능 $ F_R $ 와 함께 감싸진다.
  • 손실 마스크 $ M_t = 0 $ 일 경우, 음성 회복 셀 $ F_R $ 는 이전 상태와 마스크된 입력의 맥락을 사용하여 회복된 프레임 $ \hat{\mathbf{x}}_t $ 를 예측한다.
  • 모델은 음성 프레임에 대한 복원 손실과 정서 레이블에 대한 교차 엔트로피 손실을 사용하여 엔드 투 엔드로 훈련된다.
  • 양방향 버전의 ConcealNet은 전방 및 후방 은닉 상태를 평균내어 손실 회복에 대한 맥락 인식 능력을 향상시킨다.
  • 스트레스 훈련 기법은 고손실 상황(예: $ p_L = 0.9 $)에서 모델을 훈련시켜 장시간 손실 시퀀스에 대한 일반화 능력을 향상시킨다.
  • 전체 시스템은 ConcealNet과 엔드 투 엔드 SER 헤드를 조합하여 손실이 발생하는 입력에서 동시에 음성 복원과 정서 예측을 수행할 수 있도록 한다.

실험 결과

연구 질문

  • RQ1엔드 투 엔드 신경망 기반 PLC 모듈이 특정 화면 손실 상황에서 음성 정서 인식 성능을 향상시킬 수 있는가?
  • RQ2기존의 PLC 기준(예: 0-치환, 선형 보간)과 비교할 때 ConcealNet은 음성 복원 및 정서 예측 측면에서 어떤 성능을 보이는가?
  • RQ3양방향 처리가 장시간 손실 상황에서 PLC 성능을 향상시키는가?
  • RQ4스트레스 훈련이 장시간 패킷 손실에 대한 ConcealNet의 강건성을 상당히 향상시킬 수 있는가?
  • RQ5ConcealNet과 SER를 동시에 엔드 투 엔드로 훈련시키는 것이 전체 시스템 성능 향상에 어느 정도 기여하는가?

주요 결과

  • ConcealNet은 중간 수준의 손실(10.16% 손실률) 조건에서 정서 예측 CCC를 원본의 76.93%에서 75.99%로, 각각의 각성도(Arousal)에 대해 43.18%에서 39.81%로 감소시켰으며, 성능 저하가 최소한이었다.
  • 양방향 버전의 ConcealNet은 단방향 버전을 초월하여 10.16% 손실 조건에서 각성도에 대해 76.86% CCC, 각성도에 대해 43.18%의 성능을 기록했다.
  • 고손실률(예: 50.06% 및 90.15%) 조건에서 스트레스 훈련된 ConcealNet 모델은 비스트레스 모델보다 유의미하게 높은 성능을 유지했으며, 특히 각성도 예측에서 두드러졌다.
  • 가장 극단적인 경우($ p_L = 0.9 $)에서는 0-치환 기준이 ConcealNet보다 음성 회복 성능에서 뛰어났지만, 스트레스 훈련 덕분에 정서 예측 성능이 최대 10%p 향상되었다.
  • 스트레스 훈련 기법은 장시간 손실 시퀀스에 대한 강건성을 효과적으로 향상시켰으며, ConcealNet이 최대 9개의 연속된 손실 프레임을 복구해야 하는 상황에서도 성능 저하를 줄였다.
  • ConcealNet과 SER 헤드를 통합한 전체 엔드 투 엔드 시스템은 RECOLA 데이터셋에서 최신 기술 수준의 성능을 달성하여, 통합된 PLC와 정서 인식의 실현 가능성과 효과성을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.