[논문 리뷰] Enhancing ASR for Stuttered Speech with Limited Data Using Detect and Pass
이 논문은 소량의 레이블된 데이터를 사용하여 끊어지는 말하기의 음성 인식 성능을 향상시키기 위한 경량 방법인 'Detect and Pass'를 제안한다. 이 방법은 문맥을 고려한 분류기를 훈련시켜 끊어지는 프레임을 탐지한 후, 추론 과정에서 이러한 프레임과 그 후행 확률을 ASR 모델에 전달하여, 최신 RNN-T 기반 모델들에서 최대 71.24%까지 단어 오류률(WER)을 감소시킨다. 특히 작은 크기의 ASR 모델에서 뚜렷한 성능 향상을 이룬다.
It is estimated that around 70 million people worldwide are affected by a speech disorder called stuttering. With recent advances in Automatic Speech Recognition (ASR), voice assistants are increasingly useful in our everyday lives. Many technologies in education, retail, telecommunication and healthcare can now be operated through voice. Unfortunately, these benefits are not accessible for People Who Stutter (PWS). We propose a simple but effective method called 'Detect and Pass' to make modern ASR systems accessible for People Who Stutter in a limited data setting. The algorithm uses a context aware classifier trained on a limited amount of data, to detect acoustic frames that contain stutter. To improve robustness on stuttered speech, this extra information is passed on to the ASR model to be utilized during inference. Our experiments show a reduction of 12.18% to 71.24% in Word Error Rate (WER) across various state of the art ASR systems. Upon varying the threshold of the associated posterior probability of stutter for each stacked frame used in determining low frame rate (LFR) acoustic features, we were able to determine an optimal setting that reduced the WER by 23.93% to 71.67% across different ASR systems.
연구 동기 및 목표
- 훈련 데이터의 다수결 편향으로 인해 ASR 시스템이 끊어지는 말하기에서 성능이 떨어지는 문제를 해결하기 위해.
- 낮은 데이터 환경에서 끊어지는 말을 하는 사람(PWS)을 위한 ASR의 강인성을 향상시키는 방법을 개발하기 위해.
- 기본 ASR 모델을 재학습하지 않고도 단순하고 가벼운 탐지 및 재지정 메커니즘이 WER를 크게 감소시킬 수 있는지 평가하기 위해.
- ASR 추론과 결합할 분류기 출력을 조합하기 위한 최적의 프레임 단위 임계값과 투표 전략을 규명하기 위해.
제안 방법
- 음성을 겹치지 않는 100ms 프레임으로 나누고, 훈련된 음성 분류기를 사용하여 각 프레임이 끊어지는지를 예측한다.
- 분류기는 각 프레임의 후행 확률을 출력하여 끊어짐의 가능성을 나타낸다.
- 후행 확률이 높은 끊어지는 프레임은 추론 과정에서 별도의 입력 스트림으로 ASR 모델에 전달된다.
- LFR 특징은 연속된 세 개의 프레임을 스택하여 생성되며, 다양한 투표 전략(다数, 임계값 기반, 평균 임계값 등)을 적용하여 각 LFR 프레임의 최종 끊어짐 레이블을 결정한다.
- ASR 모델은 원본 입력과 함께 탐지된 끊어지는 프레임을 모두 처리하여, 어색한 영역에 더 집중적으로 주의를 기울일 수 있도록 한다.
- 이 방법은 재학습 없이 RNN-T 기반 ASR 모델에 적용 가능하므로 플러그인 방식의 향상 전략이 된다.
실험 결과
연구 질문
- RQ1간단하고 데이터 효율적인 분류기가 높은 정확도로 음성 내 끊어지는 프레임을 탐지할 수 있는가?
- RQ2탐지된 끊어지는 프레임과 그 후행 확률을 ASR 모델에 전달함으로써 끊어지는 말하기에서 WER가 감소하는가?
- RQ3다른 양의 데이터로 훈련된 ASR 모델들에 대해 Detect and Pass 방법의 성능는 어떻게 변하는가?
- RQ4다수결 투표, 평균 임계값 등과 같은 프레임 단위 집계 전략 중 어느 것이 WER 감소에 가장 효과적인가?
- RQ5LFR 기반 추론 파이프라인에서 WER 감소를 최대화하는 데 가장 적합한 후행 확률의 최적 임계값은 무엇인가?
주요 결과
- Detect and Pass 방법은 200,000시간의 데이터로만 훈련된 RNN-T1 모델에서 WER을 최대 71.24%까지 감소시켰다.
- 더 큰 모델들(RNN-T2, RNN-T3)의 경우 감소율은 낮았지만 여전히 유의미했으며, 각각 38.03%와 12.18%의 감소를 기록했다.
- 평균 후행 확률에 대한 최적의 임계값은 0.8로, RNN-T3에서 23.93%의 WER 감소를 이끌어냈다.
- 'any_0' 투표 전략은 RNN-T1과 같이 작은 모델에서 가장 우수한 성능를 보였고, 더 큰 모델에서는 높은 임계값(0.8)이 최적의 성능를 보였다.
- 이 방법은 누적적인 성능 향상을 보였으며, 특히 작은 ASR 모델에서 더 큰 이점을 제공하여 낮은 데이터 환경에서의 가치를 입증했다.
- 분류기는 테스트 세트에서 PR-AUC > 75%를 달성하여, 제한된 데이터 환경에서 '충분히 좋은' 탐지기로서의 효과성을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.