[논문 리뷰] An evaluation of word-level confidence estimation for end-to-end automatic speech recognition
이 논문은 구조적이고 순서 기반의 출력에 적합하게 불확실성 추정 기법을 적응시켜 엔드 투 엔드 자동 음성 인식(ASR)에서 단어 수준의 신뢰도 추정을 평가한다. 온도 조정을 통해 로그릿(logit)을 조정하고, 이를 바탕으로 음소 수준의 불확실성 추정을 계산한 후 토큰 간의 합 풀링(sum pooling)을 수행하는 방법이 단어 수준의 신뢰도 점수 산출에 있어 강력한 베이스라인을 제공하며, LibriSpeech, TED-LIUM, CommonVoice 데이터셋에서 AUPR 및 AUROC를 크게 향상시킨다.
Quantifying the confidence (or conversely the uncertainty) of a prediction is a highly desirable trait of an automatic system, as it improves the robustness and usefulness in downstream tasks. In this paper we investigate confidence estimation for end-to-end automatic speech recognition (ASR). Previous work has addressed confidence measures for lattice-based ASR, while current machine learning research mostly focuses on confidence measures for unstructured deep learning. However, as the ASR systems are increasingly being built upon deep end-to-end methods, there is little work that tries to develop confidence measures in this context. We fill this gap by providing an extensive benchmark of popular confidence methods on four well-known speech datasets. There are two challenges we overcome in adapting existing methods: working on structured data (sequences) and obtaining confidences at a coarser level than the predictions (words instead of tokens). Our results suggest that a strong baseline can be obtained by scaling the logits by a learnt temperature, followed by estimating the confidence as the negative entropy of the predictive distribution and, finally, sum pooling to aggregate at word level.
연구 동기 및 목표
- 최근 현대 음성 인식에서 점점 더 지배적인 엔드 투 엔드 ASR 시스템에 특화된 신뢰도 추정 기법의 부족을 해결하기 위해.
- 원래 비구조적 딥러닝 또는 레이티스 기반 시스템을 위해 설계된 기존의 불확실성 추정 기법을 엔드 투 엔드 ASR의 순서 기반 단어 수준의 신뢰도 추정에 적응시키기 위해.
- 두 가지 핵심 과제를 해결하기 위해: 구조적 순서 기반 출력을 모델링하고, 토큰 수준의 불확실성을 더 넓은 단어 수준의 예측으로 집계하기 위해.
- 다양한 표준 음성 인식 데이터셋을 대상으로 포괄적인 신뢰도 추정 기법의 벤치마킹을 수행하여 가장 효과적인 접근법을 규명하기 위해.
- 사용 가능한 토큰 포스터리어만을 사용하여 향후 연구를 위한 재현 가능하고 단순하며 효과적인 베이스라인을 제공하기 위해.
제안 방법
- 사전 훈련된 엔드 투 엔드 ASR 모델의 최종 로그릿에 온도 조정을 적용하여 토큰 수준의 확률 분포의 校정성(calibration)을 향상시킨다.
- 예측된 토큰 분포의 음성 엔트로피(negative entropy)를 사용하여 신뢰도 점수를 계산하고, 이를 불확실성의 대체 지표로 활용한다.
- 토큰 수준의 신뢰도 점수를 합 풀링(sum pooling)을 통해 단어 수준의 신뢰도로 집계하여 번역 작업에서 사용자 중심의 오류 탐지 기능을 가능하게 한다.
- 추가적인 신뢰도 추정 기법 평가: 몬테카를로 드롭아웃(Monte Carlo dropout, 64회 전파 평균화) 및 독립적으로 훈련된 모델의 앙상블.
- 모든 실험에서 추론과 신뢰도 점수 산출에 동일한 사전 훈련된 ASR 모델을 사용하여 일관성과 재현 가능성을 확보한다.
- 각 데이터셋의 개발 분할에서 온도 파라미터를 최적화하고, 온도 조정 + 드롭아웃 등의 조합 기법을 적용하여 상호 보완 효과를 평가한다.

실험 결과
연구 질문
- RQ1엔드 투 엔드 ASR에서 단어 수준에서 가장 우수한 성능을 보이는 신뢰도 추정 기법은 로그릿 확률, 음성 엔트로피, 또는 몽테카를로 드롭아웃 중 어느 것인가?
- RQ2로그릿의 온도 조정이 엔드 투 엔드 ASR 시스템에서 신뢰도 점수의 신뢰성에 어떤 영향을 미치는가?
- RQ3온도 조정과 드롭아웃 등의 다수의 신뢰도 추정 기법을 조합하면 개별 기법보다 성능 향상이 이루어지는가?
- RQ4토큰 수준의 신뢰도 점수를 합 풀링하는 것이 의미 있는 단어 수준의 불확실성 추정을 생성하는 데 얼마나 효과적인가?
- RQ5사전 훈련된 ASR 모델의 예측 성능이 높을수록 그에 따라 신뢰도 점수의 신뢰성도 높아지는가?
주요 결과
- 로그릿의 온도 조정이 모든 지표에서 신뢰도 추정 성능을 크게 향상시켜 AUPR 및 AUROC에서 가장 큰 향상을 이룬다.
- 온도 조정과 음성 엔트로피 특징의 조합에 더해 합 풀링을 적용한 방법이 가장 우수한 전체 성능을 기록하였으며, TED-LIUM 테스트 세트에서 AUROC 85.18%, AUPR 41.15%를 달성하였다.
- 64회 실행한 몽테카를로 드롭아웃은 기준 성능을 향상시켰으며, 온도 조정과 앙상블을 병행할 경우 AUPR이 28.58%에서 33.00%로 상승하였다.
- 독립적으로 훈련된 다수의 모델을 앙상블하면 신뢰도 점수 향상에 기여하였으며, 특히 온도 조정과 병행할 경우 AUPR 34.57%, AUROC 81.64%를 기록하였다.
- 사전 훈련된 모델의 예측 성능이 높을수록 그에 따라 신뢰도 점수 성능도 높아지는 경향을 보였으며, 이는 고정확도 모델이 자연스럽게 더 나은 불확실성 추정을 지원할 수 있음을 시사한다.
- 음성 엔트로피 특징은 온도 조정에서 더 큰 향상을 보였고, 로그릿 확률 특징은 드롭아웃에서 더 큰 이점을 얻었으며, 이는 각 특징이 메서드 개선에 대해 서로 다른 민감도를 보임을 나타낸다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.