Skip to main content
QUICK REVIEW

[논문 리뷰] Evaluating User Perception of Speech Recognition System Quality with Semantic Distance Metric

Suyoun Kim, Manh Duc Le|arXiv (Cornell University)|2021. 10. 11.
Speech Recognition and Synthesis인용 수 4
한 줄 요약

이 논문은 사전 훈련된 언어 모델 임베딩 기반의 의미 거리 측정법인 SemDist를 제안한다. 이는 어휘 수준의 오류가 아닌 의미적 정확도를 측정하여 자동 음성 인식(ASR) 출력 품질을 평가한다. SemDist는 인간 사용자 인식 및 후속 NLU 작업과의 상관관계에서 워드 오류률(WER)보다 유의미하게 높은 상관관계를 보이며, 특히 쌍별 토큰 기반의 XLM 임베딩에서 가장 우수한 성능을 보였다. 이는 71,000건과 36,000건의 사용자 애너테이션 기반 ASR 평가에서 입증되었다.

ABSTRACT

Measuring automatic speech recognition (ASR) system quality is critical for creating user-satisfying voice-driven applications. Word Error Rate (WER) has been traditionally used to evaluate ASR system quality; however, it sometimes correlates poorly with user perception/judgement of transcription quality. This is because WER weighs every word equally and does not consider semantic correctness which has a higher impact on user perception. In this work, we propose evaluating ASR output hypotheses quality with SemDist that can measure semantic correctness by using the distance between the semantic vectors of the reference and hypothesis extracted from a pre-trained language model. Our experimental results of 71K and 36K user annotated ASR output quality show that SemDist achieves higher correlation with user perception than WER. We also show that SemDist has higher correlation with downstream Natural Language Understanding (NLU) tasks than WER.

연구 동기 및 목표

  • 기존의 WER와 인간 사용자 인식 간의 낮은 상관관계 문제를 해결하기 위해.
  • 사전 훈련된 언어 모델 임베딩를 통해 측정한 의미적 정확도가 어휘 수준 오류율보다 사용자 판단을 더 잘 반영하는지 평가하기 위해.
  • 다양한 의미 거리 계산 전략을 비교하여 사용자 인식 모델링에 가장 강력한 방법을 규명하기 위해.
  • SemDist가 음성 기반 애플리케이션에서 사용자 만족도 예측 및 모델 선택 향상에 어떻게 활용될 수 있는지 보여주기 위해.

제안 방법

  • 사전 훈련된 트랜스포머 기반 언어 모델(예: RoBERTa, XLM)을 사용해 참조 및 가설 전사본의 의미 임베딩을 계산한다.
  • 참조 및 가설의 평균 풀링 또는 [CLS]-토큰 임베딩 간의 코사인 거리로 의미 거리(SemDist)를 계산한다.
  • 다음 네 가지 SemDist 변형을 탐색한다: RoBERTa-평균 풀링, XLM-평균 풀링, XLM-[CLS], XLM-쌍별 토큰 임베딩 방법.
  • 사용자 판단(UserChoice, UserRating) 및 후속 NLU 작업(의도 정확도, EM, EMTree)과의 상관관계를 비교하기 위해 피어슨 상관계수를 사용한다.
  • WER, SemDist 또는 둘 다를 입력 특징으로 사용해 사용자 평가를 예측하는 선형 회귀 모델을 훈련한다.
  • WER와 SemDist 간의 순위 차이를 분석하여 평가 방식의 상이한 행동을 이해한다.

실험 결과

연구 질문

  • RQ1SemDist는 인간 사용자 인식과의 상관관계에서 워드 오류률(WER)보다 더 강하게 관련되어 있는가?
  • RQ2의미 임베딩 계산 방법(예: 평균 풀링, [CLS], 쌍별 토큰) 중에서 사용자 인식에 가장 강력한 SemDist를 제공하는 방법은 무엇인가?
  • RQ3의도 인식 및 의미 구문 분석과 같은 후속 NLU 작업 예측에서 SemDist는 WER보다 어떻게 비교되는가?
  • RQ4SemDist를 사용해 고비용의 인간 애너테이션 없이도 사용자 만족도를 정확히 예측할 수 있는 모델을 훈련시킬 수 있는가?

주요 결과

  • 모든 테스트 데이터셋에서 SemDist는 사용자 인식(UserChoice 및 UserRating)과 WER보다 유의미하게 높은 피어슨 상관계수를 보였다.
  • XLM-쌍별 토큰 SemDist 방법이 사용자 판단과 가장 높은 상관관계를 보이며, RoBERTa 기반 및 평균 풀링 변형보다 뛰어난 성능을 보였다.
  • SemDist는 후속 NLU 작업(1 - IntentAcc, 1 - EM, 1 - EMTree)과 WER보다 더 강한 상관관계를 보이며, 이는 체계 수준의 성능와의 보다 우수한 일치를 의미한다.
  • 단지 SemDist만을 사용한 선형 회귀 모델은 사용자 평가 예측에서 R² = 0.35를 기록했으며, WER 전용 모델(R² = 0.12)보다 뛰어났다.
  • SemDist 기반 모델은 평균 절대 오차(MAE) 0.29를 기록했으며, WER와 SemDist를 모두 사용한 최고 성능 모델과 동일한 성능을 보였다. 이는 SemDist의 강력한 예측 능력을 시사한다.
  • SemDist는 WER가 구분하지 못하는 의미적으로 비논리적인 오류(예: '알람 취소' vs. '알람 설정')를 효과적으로 처벌함으로써 의미적 민감도를 보여주었다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.