[논문 리뷰] A Benchmarking on Cloud based Speech-To-Text Services for French Speech and Background Noise Effect
이 연구는 40,158개의 오디오 파일(~101시간)에 걸쳐 프랑스어 음성에 대해 네 가지 클라우드 기반 음성 인식(STT) 서비스—Google 클라우드, Microsoft Azure, Amazon Transcribe, IBM Watson—를 평가하였다. 배경 소음 수준은 40 dB에서 0 dB SNR까지 다섯 단계로 설정되었다. Microsoft Azure가 중앙값 단어오류률(WER)이 가장 낮은 9.09%를 기록했으며, 특히 저SNR 조건에서 다른 서비스들보다 뛰어난 소음에 대한 내성을 보였다.
This study presents a large scale benchmarking on cloud based Speech-To-Text systems: {Google Cloud Speech-To-Text}, {Microsoft Azure Cognitive Services}, {Amazon Transcribe}, {IBM Watson Speech to Text}. For each systems, 40158 clean and noisy speech files about 101 hours are tested. Effect of background noise on STT quality is also evaluated with 5 different Signal-to-noise ratios from 40dB to 0dB. Results showed that {Microsoft Azure} provided lowest transcription error rate $9.09\%$ on clean speech, with high robustness to noisy environment. {Google Cloud} and {Amazon Transcribe} gave similar performance, but the latter is very limited for time-constraint usage. Though {IBM Watson} could work correctly in quiet conditions, it is highly sensible to noisy speech which could strongly limit its application in real life situations.
연구 동기 및 목표
- 다국어 STT 평가에서의 격차를 메우기 위해 프랑스어 언어를 대상으로 대규모 클라우드 기반 STT 서비스 평가를 수행한다.
- 배경 소음이 STT 성능에 미치는 영향, 특히 다양한 신호 대 잡음비(SNR)에서의 영향을 평가한다.
- 실제 환경 조건에서 네 가지 주요 STT API 간의 응답 시간, 오류율, 내성 등을 비교한다.
- 소음 제약 조건이 있는 프랑스어 응용 프로그램을 위한 개발자 및 조직이 STT 서비스를 선택할 때 실질적인 통찰을 제공한다.
제안 방법
- 청결한 프랑스어 음성 파일 6,693개(~17시간)를 수집하고 처리하였으며, 18종류의 배경 소음을 다섯 단계의 SNR 수준(40 dB에서 0 dB)으로 추가하여 총 33,465개의 노이즈 있는 버전을 생성하였다.
- 네 가지 클라우드 기반 STT API를 사용: Google Cloud Speech-to-Text, Microsoft Azure Cognitive Services, Amazon Transcribe, IBM Watson Speech to Text.
- 모든 40,158개의 오디오 파일(총 101시간)에 대해 배치 전사 작업을 수행하였으며, 단어오류률(WER), 작업 완료 시간, 오류 유형 분포를 측정하였다.
- 표준 지표를 적용: WER의 중앙값과 사분자구간, 오류 유형 분석(치환, 삭제, 삽입), 작업당 응답 시간.
- 42명의 다른 프랑스어 화자에 대해 분석하여 화자 간 변동성을 평가하였다.
- SNR를 소음 내성 평가의 핵심 변수로 사용하였으며, 결과는 각 SNR 수준과 서비스별로 집계되었다.
실험 결과
연구 질문
- RQ1다섯 가지 노이즈 수준에서 프랑스어 음성에 대해 네 가지 주요 클라우드 기반 STT 서비스의 단어오류률(WER)은 어떻게 달라지나?
- RQ2특히 저SNR(예: 0–10 dB) 조건에서 배경 소음에 가장 강한 내성을 보이는 STT 서비스는 무엇인가?
- RQ3오디오 길이와 전사 작업 완료 시간 사이의 관계는 네 가지 STT 서비스 전반에서 어떻게 나타나는가?
- RQ4노이즈 수준 증가에 따라 오류 유형(치환, 삭제, 삽입)이 어떻게 변화하며, 다양한 STT 제공업체 간에 어떻게 다름?
- RQ5응답 시간과 시스템 제약 조건(예: Amazon S3 의존성)이 실시간 또는 시간 제약이 있는 응용 프로그램에 실질적인 영향을 미치는가?
주요 결과
- Microsoft Azure는 청결한 프랑스어 음성에서 가장 낮은 중앙값 WER 9.09%를 기록했으며, Google Cloud(11.76%), Amazon Transcribe(14.00%), IBM Watson(14.29%)를 모두 앞섰다.
- Microsoft Azure는 소음에 강력한 내성을 유지했으며, 0 dB SNR에서 중앙값 WER가 16.67%로 높아졌지만, 이는 IBM Watson가 동일 조건에서 약 70%에 이르게 되는 것과 비교해 뚜렷한 우위를 보였다.
- Google Cloud는 가장 빠른 STT 서비스였으며, 평균 작업 완료 시간이 1.76초/오디오 파일이었고, 이는 Microsoft Azure(3.51 s), IBM Watson(5.43 s), Amazon Transcribe(27.00 s)에 이어졌다.
- Amazon Transcribe는 평균 27초의 가장 긴 작업 지연을 보였으며, 오디오를 Amazon S3에 업로드해야 하는 점으로 인해 대규모 배치 처리에 있어 복잡성과 지연이 더해졌다.
- 치환 오류는 청결한 음성과 중간 수준의 노이즈에서 주요 오류 유형이었으며, SNR < 10 dB에서 삭제 오류 비율이 크게 증가했으며, 특히 IBM Watson과 Amazon Transcribe에서 두드러졌다.
- 레스토랑 소음은 모든 STT 서비스에서 가장 도전적인 소음으로 나타났으며, 모든 제공업체에서 WER를 크게 높였고, 특히 IBM Watson과 Amazon Transcribe에서 두드러졌다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.