Skip to main content
QUICK REVIEW

[논문 리뷰] Automated speech audiometry: Can it work using open-source pre-trained Kaldi-NL automatic speech recognition?

Gloria Araiza-Illan, Luke Meyer|PubMed|2023. 12. 19.
Hearing Loss and Rehabilitation참고 문헌 48인용 수 4
한 줄 요약

이 연구는 실시간 음성 인식을 위한 오픈소스 Kaldi-NL를 사용하여 자동화된 청력 청취 검사 시스템을 제안한다. 30명의 정상청력 네덜란드 성인에서 평균 단어오류율(WER)은 5.0%를 기록하였다. 시뮬레이션 결과, 최대 네 개의 잘못된 트리플렛이 존재할 경우 SRT 변동성이 일반적인 개인 내 변동성(0.70 dB) 내에 머물러 있어, 인간 감시 없이도 임상적으로 실현 가능한 청력 스크리닝을 위한 가능성을 보여준다.

ABSTRACT

A practical speech audiometry tool is the digits-in-noise (DIN) test for hearing screening of populations of varying ages and hearing status. The test is usually conducted by a human supervisor (e.g., clinician), who scores the responses spoken by the listener, or online, where software scores the responses entered by the listener. The test has 24-digit triplets presented in an adaptive staircase procedure, resulting in a speech reception threshold (SRT). We propose an alternative automated DIN test setup that can evaluate spoken responses whilst conducted without a human supervisor, using the open-source automatic speech recognition toolkit, Kaldi-NL. Thirty self-reported normal-hearing Dutch adults (19-64 years) completed one DIN + Kaldi-NL test. Their spoken responses were recorded and used for evaluating the transcript of decoded responses by Kaldi-NL. Study 1 evaluated the Kaldi-NL performance through its word error rate (WER), percentage of summed decoding errors regarding only digits found in the transcript compared to the total number of digits present in the spoken responses. Average WER across participants was 5.0% (range 0-48%, SD = 8.8%), with average decoding errors in three triplets per participant. Study 2 analyzed the effect that triplets with decoding errors from Kaldi-NL had on the DIN test output (SRT), using bootstrapping simulations. Previous research indicated 0.70 dB as the typical within-subject SRT variability for normal-hearing adults. Study 2 showed that up to four triplets with decoding errors produce SRT variations within this range, suggesting that our proposed setup could be feasible for clinical applications.

연구 동기 및 목표

  • 오픈소스 음성인식기(ASR)를 활용한 저비용의 자동화된 기존 인간 감시가 필요한 청력 청취 검사의 대안을 개발하기 위해.
  • 사전 학습된 Kaldi-NL의 성능을 평가하기 위해, 소음 조건에서 숫자 트리플렛을 인식하는 데에 사용하기 위해.
  • ASR 디코딩 오류가 DIN 테스트에서 최종 음성 수신 임계값(SRT)에 미치는 영향을 평가하기 위해.
  • 인식 오류가 존재하더라도 Kaldi-NL 기반 자동화된 SRT 추정이 임상적으로 신뢰할 수 있는지 여부를 확인하기 위해.

제안 방법

  • 30명의 자가 보고 정상청력 네덜란드 성인에게 기록된 응답을 사용하여 DIN 테스트를 시행하고, ASR 평가를 위해 사용하였다.
  • 오픈소스 Kaldi-NL를 사용하여 기록된 응답에서 말된 숫자 트리플렛을 디코딩하였으며, 주로 숫자 인식 정확도에 중점을 두었다.
  • 참가자별로 단어오류율(WER)을 계산하였으며, 특히 목표 음성 항목에 한정하여 숫자 오류만 측정함으로써 성능를 고립적으로 평가하였다.
  • 부트스트래핑을 사용하여 최대 네 개의 트리플렛이 디코딩 오류를 포함할 경우의 SRT 추정을 시뮬레이션하여 변동성을 평가하였다.
  • 정상청력 성인의 알려진 개인 내 SRT 변동성(0.70 dB)과 오류 조건 하의 SRT 변동성을 비교하였다.
  • 실제 오류 분포를 고려한 통계적 시뮬레이션을 통해 자동화된 SRT 출력의 강건성을 평가하였다.

실험 결과

연구 질문

  • RQ1오픈소스 Kaldi-NL는 DIN 테스트에서 신뢰할 만한 숫자 인식을 위해 충분히 낮은 단어오류율(WER)을 달성할 수 있는가?
  • RQ2숫자 트리플렛의 디코딩 오류는 자동화된 청력 청취 검사에서 최종 음성 수신 임계값(SRT)에 어떻게 영향을 미치는가?
  • RQ3ASR 오류가 개인 내 변동성과 비교하여 SRT 변동성에 얼마나 큰 영향을 미치는가?
  • RQ4Kaldi-NL 기반 자동 테스트에서 도출된 SRT 출력은 임상적 사용에 충분히 안정적인가?

주요 결과

  • 참가자 간 평균 단어오류율(WER)은 5.0%였으며, 표준편차는 8.8%이며, 범위는 0%에서 48%까지였다.
  • 평균적으로 각 참가자는 세 개의 숫자 트리플렛에서 디코딩 오류를 경험하여, 중간 정도이지만 관리 가능한 오류율을 보였다.
  • 시뮬레이션 결과, 최대 네 개의 잘못된 트리플렛이 존재할 경우 SRT 변동성이 일반적인 개인 내 SRT 변동성(0.70 dB) 내에 머물러 있었다.
  • 결과적으로, Kaldi-NL 기반 자동 DIN 테스트는 인식 오류가 존재하더라도 임상적으로 신뢰할 수 있는 SRT 추정을 가능하게 한다고 제안된다.
  • 이 시스템은 인간 감시 없이도 자원이 제한된 또는 원격 청력 스크리닝 환경에 구현 가능한 가능성을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.