Skip to main content
QUICK REVIEW

[논문 리뷰] Acoustics-guided evaluation (AGE): a new measure for estimating performance of speech enhancement algorithms for robust ASR

Li Chai, Jun Du|arXiv (Cornell University)|2018. 11. 28.
Speech and Audio Processing참고 문헌 16인용 수 7
한 줄 요약

이 논문은 수동 번역이나 ASR 디코딩을 필요로 하지 않고, 강화된 음성 인식(ASR)을 위한 음성 강화 알고리즘(SEA) 성능을 평가하는 데 사용할 수 있는 새로운 척도인 청각 유도 평가(AGE)를 제안한다. AGE는 사전에 훈련된 음성 모델을 사용하여 청소된 음성과 열악한 조건의 음성 간의 상태 사후 확률 간의 교차 엔트로피를 계산함으로써, PESQ, STOI 및 엔트로피 기반 신뢰도 측정치와 비교해 가장 높은 단어 오류율(WER) 상관관계를 달성한다.

ABSTRACT

One challenging problem of robust automatic speech recognition (ASR) is how to measure the goodness of a speech enhancement algorithm (SEA) without calculating the word error rate (WER) due to the high costs of manual transcriptions, language modeling and decoding process. Traditional measures like PESQ and STOI for evaluating the speech quality and intelligibility were verified to have relatively low correlations with WER. In this study, a novel acoustics-guided evaluation (AGE) measure is proposed for estimating performance of SEAs for robust ASR. AGE consists of three consecutive steps, namely the low-level representations via the feature extraction, high-level representations via the nonlinear mapping with the acoustic model (AM), and the final AGE calculation between the representations of clean speech and degraded speech. Specifically, state posterior probabilities from neural network based AM are adopted for the high-level representations and the cross-entropy criterion is used to calculate AGE. Experiments demonstrate AGE could yield consistently highest correlations with WER and give the most accurate estimation of ASR performance compared with PESQ, STOI, and acoustic confidence measure using Entropy. Potentially, AGE could be adopted to guide the parameter optimization of deep learning based SEAs to further improve the recognition performance.

연구 동기 및 목표

  • 자동 음성 인식(ASR)에서 단어 오류율(WER)을 통한 음성 강화 알고리즘(SEA) 평가의 높은 계산 비용과 번역 비용 문제를 해결하기 위해.
  • 실제 ASR 환경에서 WER와 약한 상관관계를 보이는 전통적 객관적 척도인 PESQ와 STOI의 한계를 극복하기 위해.
  • 특히 다중 조건 훈련 하에서 신호 수준의 품질 측정치로는 감지되지 않는 ASR 관련 왜곡을 포착할 수 있는 척도를 개발하기 위해.
  • 하류 ASR 성능과 일치하는 척도를 사용해 딥 러닝 기반 SEA의 엔드 투 엔드 최적화를 가능하게 하기 위해.
  • 강화된 ASR 파ip라인에서 SEA 성능 평가를 위한 신뢰성 있고 빠르며 번역이 필요 없는 WER 대체 척도를 제공하기 위해.

제안 방법

  • 원시 음성 신호 또는 MFCC, FBANK, fMLLR와 같은 수작업 특징에서 저수준 표현(LLRs)을 추출한다.
  • 신경망 기반 음성 모델(AM)을 사용하여 비선형 변환을 통해 LLRs를 고수준 표현(HLRs)으로 매핑하며, 특히 상태 사후 확률(SPPs)을 추출한다.
  • 공식 $ \text{AGE} = -\sum_{t} \sum_{s} p_{\text{clean}}(s|t) \log p_{\text{degraded}}(s|t) $ 를 사용해 청소된 음성과 열악한 조건의 음성 간의 SPP 간 교차 엔트로피를 계산하여 AGE 점수를 산출한다.
  • HLRs가 ASR 관련 음성 정보를 반영하도록 음성 모델의 분류 지식을 활용한다.
  • AM을 청소된 데이터에서 훈련하고 AGE 계산 중에는 고정하여 일관성과 데이터 泄露를 방지한다.
  • 다양한 조건에서 AGE를 적용한다: 다양한 소음 유형, SNR 수준, SEA 알고리즘(예: OM-LSA, DNN), 훈련 방식(다중 조건 대비 청소된 조건).

실험 결과

연구 질문

  • RQ1AGE는 다양한 ASR 조건에서 전통적 왜곡 척도(PESQ, STOI) 및 음성 신뢰도(엔트로피)와 비교해 WER와 더 높은 상관관계를 보일 수 있는가?
  • RQ2SE 알고리즘이 ASR 목적이 아닌 목표(예: STOI 또는 PESQ)를 위해 최적화된 경우, AGE는 기존 척도보다 인식 성능 추정에서 뛰어난가?
  • RQ3AGE는 다양한 소음 유형과 SNR 수준, 특히 WER이 0% 또는 100%인 극한 조건에서 어떻게 성능을 발휘하는가?
  • RQ4AGE는 기존의 MMSE 또는 PESQ 기반 손실 함수 대신 딥 러닝 기반 SEA의 신뢰할 수 있는 최적화 기준으로 사용될 수 있는가?
  • RQ5AGE는 다양한 음성 모델과 언어 모델 간에서 일관된 성능을 유지하여 백엔드 변형에 대해 강건함을 입증하는가?

주요 결과

  • AGE는 모든 테스트 조건에서 WER와 가장 높은 피어슨 상관관계를 보였으며, 다중 조건 훈련 시 0.744, 청소된 조건 훈련 시 DNN 기반 SEA를 사용해 0.800의 상관관계를 기록했다.
  • 다중 조건 훈련에서 AGE는 처리되지 않은 노이즈 있는 음성에 대해 WER과 0.743의 상관관계를 보였으며, STOI(0.628), PESQ(0.554), 엔트로피(0.553)를 모두 초월했다.
  • 청소된 조건 훈련에서 AGE는 WER과 0.800의 상관관계를 기록했으며, STOI(0.615), PESQ(0.650), 엔트로피(0.554)보다 뚜렷하게 높았다.
  • AGE는 다양한 소음 유형과 SNR 수준에서 모든 기준보다 뛰어난 인식 성능 추정 능력을 보였으며, WER와 가장 강한 단조적 관계를 보였다.
  • AGE는 PESQ나 STOI를 위해 최적화되지 않은 SEA들(예: OM-LSA)을 정확하게 평가한다. 특히 STOI에서는 성능이 열악하지만 청소된 조건 훈련에서 DNN보다 더 낮은 WER을 기록하는 OM-LSA의 경우, PESQ와 STOI가 실패하는 상황에서 AGE는 정확한 평가를 수행한다.
  • 더 나은 성능을 보이는 SEA일수록 AGE 점수가 낮아지며(예: 청소된 조건 훈련에서 DNN의 AGE는 OM-LSA보다 낮음), 이는 WER와 강한 반비례 관계를 보이며 예측 정확도를 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.