Skip to main content
QUICK REVIEW

[논문 리뷰] STOI-Net: A Deep Learning based Non-Intrusive Speech Intelligibility Assessment Model

Ryandhimas E. Zezario, Szu‐Wei Fu|arXiv (Cornell University)|2020. 11. 09.
Speech and Audio Processing참고 문헌 28인용 수 15
한 줄 요약

STOI-Net은 깨끗한 음성 참조가 필요 없이 복잡한 음성 스펙트럼 특징에서 직접 STOI 점수를 예측하는 딥러닝 기반의 비침습적 음성 이해 가능성 평가 모델로, CNN-BLSTM 아키텍처에 다중 곱셈 주의 메커니즘을 통합하였다. 이는 실제 STOI 점수와 높은 상관관계(보이는 조건에서 0.97, 보이지 않는 조건에서 0.83)를 달성하여 잡음이 많거나 향상된 음성 환경에서도 강력한 일반화 능력을 보여준다.

ABSTRACT

The calculation of most objective speech intelligibility assessment metrics requires clean speech as a reference. Such a requirement may limit the applicability of these metrics in real-world scenarios. To overcome this limitation, we propose a deep learning-based non-intrusive speech intelligibility assessment model, namely STOI-Net. The input and output of STOI-Net are speech spectral features and predicted STOI scores, respectively. The model is formed by the combination of a convolutional neural network and bidirectional long short-term memory (CNN-BLSTM) architecture with a multiplicative attention mechanism. Experimental results show that the STOI score estimated by STOI-Net has a good correlation with the actual STOI score when tested with noisy and enhanced speech utterances. The correlation values are 0.97 and 0.83, respectively, for the seen test condition (the test speakers and noise types are involved in the training set) and the unseen test condition (the test speakers and noise types are not involved in the training set). The results confirm the capability of STOI-Net to accurately predict the STOI scores without referring to clean speech.

연구 동기 및 목표

  • 깨끗한 음성을 參照로 필요로 하지 않는 비침습적 음성 이해 가능성 평가 모델을 개발하는 것.
  • 기존 목적적 지표가 STOI 계산을 위해 깨끗한 음성을 필요로 하는 한계를 해결하는 것.
  • 복잡하거나 잡음이 많은 음성 환경에서 음성 이해 가능성 평가의 적용 가능성을 향상시키는 것.
  • 딥러닝을 활용하여 스펙트럼 특징에서만 복잡한 음성 열악성 패턴을 강력하게 학습하는 것.
  • 다양한 테스트 조건에서 예측된 STOI 점수와 실제 STOI 점수 간의 높은 상관관계를 달성하는 것.

제안 방법

  • 모델은 음성 스펙트럼 특징을 입력으로 받아 STOI 점수를 출력으로 예측한다.
  • 입력 스펙트로그램으로부터 계층적 시간-주파수 패턴을 추출하기 위해 CNN-BLSTM 아키텍처를 사용한다.
  • 스펙트로그램 내 관련된 시간-주파수 영역에 집중하기 위해 다중 곱셈 주의 메커니즘을 통합한다.
  • 예측된 STOI 점수와 진짜 STOI 점수 간의 평균 제곱오차 손실을 사용하여 엔드 투 엔드로 네트워크를 훈련시킨다.
  • 청취자 신호가 없는 조건에서도 깊이 있는 열악성 패턴을 학습할 수 있도록 아키텍처를 설계하였다.
  • 다양한 화자와 노이즈 유형을 포함한 보이는 조건과 보이지 않는 조건에서 테스트를 수행하였다.

실험 결과

연구 질문

  • RQ1딥러닝 모델이 깨끗한 음성을 參照로 하지 않고도 정확하게 STOI 점수를 예측할 수 있는가?
  • RQ2실제 환경에서 보이지 않는 화자와 노이즈 유형에 대해 모델의 일반화 능력은 얼마나 뛰어나게 작동하는가?
  • RQ3스펙트럼 특징에서만 STOI 점수를 예측하는 데 있어 CNN-BLSTM에 주의 메커니즘을 통합한 성능은 어떠한가?
  • RQ4기존 침습적 지표와 비교해 복잡한 음성 환경에서 비침습적 설정에서의 성능은 어떠한가?
  • RQ5주의 메커니즘이 열악한 음성 환경에서 예측 정확도 향상에 얼마나 기여하는가?

주요 결과

  • STOI-Net 모델은 훈련 세트에 포함된 화자와 노이즈 유형이 모두 존재하는 보이는 테스트 조건에서 실제 STOI 점수와 0.97의 상관관계를 달성하였다.
  • 더 도전적인 보이지 않는 테스트 조건에서도 높은 상관관계 0.83을 유지하여 강력한 일반화 능력을 입증하였다.
  • 깨끗한 음성에 접근할 수 없음에도 불구하고 STOI 점수를 성공적으로 예측하여 비침습적 성격을 확인하였다.
  • 다중 곱셈 주의 메커니즘의 통합은 모델이 관련된 스펙트럼-시간 특징에 집중하는 능력을 향상시켰다.
  • 결과적으로 딥 네트워크가 스펙트로그램에서 직접 이해 가능성 관련 열악성 패턴을 효과적으로 학습할 수 있음을 확인하였다.
  • 깨끗한 참조 신호가 필요 없기 때문에 기존 침습적 지표에 비해 비침습적 설정에서 더 뛰어난 성능을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.