Skip to main content
QUICK REVIEW

[논문 리뷰] Improving Spoken Language Understanding By Exploiting ASR N-best Hypotheses

Mingda Li, Weitong Ruan|arXiv (Cornell University)|2020. 01. 11.
Topic Modeling참고 문헌 16인용 수 14
한 줄 요약

이 논문은 자동 음성 인식(ASR) 오류에 대한 말하기 언어 이해(SLU)의 강건성을 향상시키기 위해 첫 번째 최선의 번역 결과에만 의존하는 것 대신 n-best ASR 가설을 통합하는 방법을 제안한다. 다수의 가설에서 예측을 집계하거나 풀링 및 직접 모델링과 같은 방법을 사용해 임베딩을 연결함으로써, 도메인 및 의도 분류에서 최대 25%의 상대 오류 감소를 달성한다. 특히 ASR의 첫 번째 최선의 결과가 잘못되었을 경우에 효과가 뚜렷하다.

ABSTRACT

In a modern spoken language understanding (SLU) system, the natural language understanding (NLU) module takes interpretations of a speech from the automatic speech recognition (ASR) module as the input. The NLU module usually uses the first best interpretation of a given speech in downstream tasks such as domain and intent classification. However, the ASR module might misrecognize some speeches and the first best interpretation could be erroneous and noisy. Solely relying on the first best interpretation could make the performance of downstream tasks non-optimal. To address this issue, we introduce a series of simple yet efficient models for improving the understanding of semantics of the input speeches by collectively exploiting the n-best speech interpretations from the ASR module.

연구 동기 및 목표

  • 인식 오류로 인해 잘못될 수 있는 ASR의 첫 번째 최선의 가설에만 의존하는 SLU 시스템의 한계를 해결하기 위해.
  • n-best 목록에서 유래한 다수의 가설을 활용하여, ASR 오류가 존재하는 상황에서도 말하기 언어 이해의 강건성을 향상시키기 위해.
  • 후속 NLU 성능 향상을 위해 훈련 및 추론 시 n-best ASR 출력을 실용적으로 통합하는 방법을 개발하고 평가하기 위해.
  • 첫 번째 최선의 결과가 잘못되었을 경우에 특히 일관된 성능 향상이 이루어지는 다수의 가설 사용의 효과를 입증하기 위해.
  • 신뢰도 점수, 토큰 수준의 특징, 단어 라티스와 같은 구조적 표현을 활용한 고급 통합 기법에 대한 향후 연구를 위한 기반을 마련하기 위해.

제안 방법

  • 첫 번째 최선의 번역 결과 대신 n-best ASR 가설(n=5)을 NLU 모델의 입력으로 사용한다.
  • BiLSTM 인코더에서 생성된 가설 임베딩을 풀링(예: 평균 풀링 또는 최대 풀링)을 통해 특징 수준에서 통합한다.
  • 다중 가설 텍스트 또는 그들의 임베딩을 연결하여 분류 헤드에 입력하는 직접 모델링 방식을 구현한다.
  • 지표 번역 결과가 n-best 목록에 포함되어 있지 않은 경우에도 일반화 능력을 향상시키기 위해 훈련 시 n-best 가설을 사용한다.
  • 재순서 정렬 및 통합 전략에서 보조적 특징으로 신뢰도 점수와 순위 위치를 사용한다.
  • 도메인 및 의도 분류 작업에서 기준 모델(첫 번째 최선의 결과만 사용), 오라클(지표 번역 결과), 다양한 통합 전략을 비교 평가한다.

실험 결과

연구 질문

  • RQ1첫 번째 최선의 가설에 의존하는 것보다 다수의 n-best ASR 가설을 통합함으로써 말하기 언어 이해의 정확도를 향상시킬 수 있는가?
  • RQ2ASR의 첫 번째 최선의 가설이 잘못되었을 경우와 올바르게 되었을 경우에 SLU 모델의 성능은 어떻게 달라지는가?
  • RQ3풀링, 연결, 또는 직접 모델링 중 어떤 통합 전략이 NLU 작업에서 가장 강건하고 효과적인 성능 향상을 이끌어내는가?
  • RQ4사용하는 n-best 가설의 수가 최종 분류 성능에 어떤 영향을 미치는가?
  • RQ5n-best 가설을 기반으로 훈련된 모델은 지표 번역 결과가 n-best 목록에 포함되어 있지 않은 경우에도 더 나은 일반화 능력을 보일 수 있는가?

주요 결과

  • 제안된 n-best ASR 가설 통합은 도메인 분류에서 최대 25%의 상대 오류 감소를 이끌었으며, 가장 우수한 성능을 보인 방법(PoolingAvg)은 첫 번째 최선의 가설이 번역 결과와 다를 경우 24.67%의 상대 오류 감소를 기록했다.
  • 첫 번째 최선의 가설이 번역 결과와 일치하는 부분집합에서는 통합 모델이 여전히 성능 향상을 보였으며, PoolingAvg는 3.56%의 상대 오류 감소를 기록하여 첫 번째 최선의 결과가 올바를 경우에도 강건성을 입증했다.
  • 신뢰도 점수 순으로 가설을 정렬한 Direct 모델은 오해의 부분집합에서 9.95%의 상대 오류 감소를 기록했으며, 다수결 투표(7.59%) 및 오라클을 활용한 재순서 정렬(7.25%)보다 뛰어난 성능을 보였다.
  • 가설 수가 많아질수록 성능 향상이 지속적으로 이루어지지만, 네 개 이상의 가설을 사용할 경우 수익 감소 현상이 나타나며, n=4 이후부터는 성능 향상 폭이 줄어든다.
  • PoolingAvg 방법은 테스트한 8개 주요 도메인 전반에서 일관되게 정확도 향상을 보였으며, 넓은 적용 가능성과 강건성을 입증했다.
  • 의도 분류에서 PoolingAvg는 쇼핑 도메인에서 25.55%의 상대 오류 감소, 지식 도메인에서 25.00%, 커뮤니케이션 도메인에서 11.92%의 상대 오류 감소를 기록하여 기준 모델 대비 뚜렷한 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.