Skip to main content
QUICK REVIEW

[논문 리뷰] Investigation of Error Simulation Techniques for Learning Dialog Policies for Conversational Error Recovery

Maryam Fazel-Zarandi, Longshaokan Marshall Wang|arXiv (Cornell University)|2019. 11. 08.
Speech and dialogue systems참고 문헌 34인용 수 11
한 줄 요약

이 논문은 음성 기반 가상 비서에서 대화 정책 학습을 위한 오디오 수준 및 텍스트 수준 오류 시뮬레이션 기법을 조사하며, ASR 신뢰도 점수 예측과 OOV(Out-of-Vocabulary) 단어 매핑을 통한 텍스트 수준 기법의 개선을 제안한다. 연구 결과, 텍스트 수준 시뮬레이션은 현실성 면에서 오디오 수준 시뮬레이션과 유사하며, 속도와 단순성 덕분에 더 선호되며, 단어 오류율, 신뢰도 점수 분포, 실제 오류와의 분류 가능성 등에서 향상된 메트릭스를 기록한다.

ABSTRACT

Training dialog policies for speech-based virtual assistants requires a plethora of conversational data. The data collection phase is often expensive and time consuming due to human involvement. To address this issue, a common solution is to build user simulators for data generation. For the successful deployment of the trained policies into real world domains, it is vital that the user simulator mimics realistic conditions. In particular, speech-based assistants are heavily affected by automatic speech recognition and language understanding errors, hence the user simulator should be able to simulate similar errors. In this paper, we review the existing error simulation methods that induce errors at audio, phoneme, text, or semantic level; and conduct detailed comparisons between the audio-level and text-level methods. In the process, we improve the existing text-level method by introducing confidence score prediction and out-of-vocabulary word mapping. We also explore the impact of audio-level and text-level methods on learning a simple clarification dialog policy to recover from errors to provide insight on future improvement for both approaches.

연구 동기 및 목표

  • 음성 기반 비서에서 대화 정책 학습을 위한 오디오 수준 및 텍스트 수준 오류 시뮬레이션 기법의 현실성 평가 및 비교.
  • 기존의 텍스트 수준 오류 시뮬레이션을 향상시키기 위해 ASR 신뢰도 점수 예측 및 OOV 단어 매핑을 도입.
  • 두 시뮬레이션 기법이 오류 복구를 위한 명시적 질문 기반 대화 정책 학습에 미치는 영향 평가.
  • 예측된 신뢰도 점수와 단어 오류율 특징을 통합하여 더 견고한 분류기 개발.
  • 보류된 데이터 평가 및 정책 성능에 대한 사용자 연구를 통한 시뮬레이션 품질 검증.

제안 방법

  • 실제 ASR 출력 기반 오디오 수준 시뮬레이션과 훈련 데이터에서 유도된 n-그램 혼동 행렬 기반 텍스트 수준 시뮬레이션을 사용하는 비교 프레임워크 도입.
  • 시뮬레이션된 ASR 출력에서 ASR 신뢰도 점수를 예측하는 모델을 학습시켜, 오디오 입력 없이도 현실적인 신호 모델링이 가능한 텍스트 수준 시뮬레이션 개선.
  • 음운학적 및 의미적 유사성 기반 OOV 단어 매핑을 도입하여 텍스트 수준 시뮬레이션의 오류 현실성 향상.
  • 실제 데이터와 시뮬레이션 데이터를 구분하는 데 사용되는 분류기 네트워크를 개선하기 위해 예측된 신뢰도 점수와 단어 오류율(WER)을 입력 특징으로 포함.
  • 경험 재생과 선형 감소를 갖는 에psilon-그리디 탐색을 사용한 딥 강화학습을 통해 명시적 질문 정책을 학습하며, 듀얼링 더블 DQN 사용.
  • 다양한 시뮬레이션 조건 하에서 정책 성능을 비교하기 위해 추론 분석 및 보류된 데이터에 대한 사용자 평가 수행.

실험 결과

연구 질문

  • RQ1단어 오류율 분포와 ASR 신뢰도 점수 현실성 측면에서 오디오 수준 및 텍스트 수준 오류 시뮬레이션 기법은 어떻게 비교될 수 있는가?
  • RQ2텍스트 수준 오류 시뮬레이션은 실제 ASR 및 NLU 오류를 모방하는 데 있어 오디오 수준 시뮬레이션과 유사한 현실성을 달성할 수 있는가?
  • RQ3신뢰도 점수 예측 및 OOV 단어 매핑이 텍스트 수준 오류 시뮬레이션 품질을 얼마나 향상시키는가?
  • RQ4시뮬레이션된 오류는 명시적 질문 기반 대화 정책 학습에 대해 임무 성공률 및 사용자 만족도 측면에서 어떤 영향을 미치는가?
  • RQ5예측된 신뢰도 점수와 WER 특징을 기반으로 훈련된 분류기는 실제 대화 데이터와 시뮬레이션된 데이터를 효과적으로 구분할 수 있는가?

주요 결과

  • 텍스트 수준 오류 시뮬레이션은 실제 ASR 오류와 통계적으로 구분되지 않는 단어 오류율 및 신뢰도 점수 분포를 달성하여 오디오 수준 시뮬레이션과 거의 동일한 현실성을 확보한다.
  • 제안된 신뢰도 점수 예측 모델은 시뮬레이션된 텍스트 출력에서 ASR 신뢰도를 성공적으로 추정하여 오디오 신호 없이도 더 현실적인 정책 학습이 가능하게 한다.
  • 음운학적 및 의미적 유사성 기반 OOV 단어 매핑은 희귀어 또는 도메인 전용 용어에 대해 텍스트 수준 시뮬레이션의 오류 현실성을 크게 향상시킨다.
  • 예측된 신뢰도 점수와 WER를 통합한 개선된 분류기는 실제 데이터와 시뮬레이션 데이터를 구분하는 데 더 높은 정확도를 기록하여 향상된 시뮬레이션 품질을 검증한다.
  • 텍스트 수준 시뮬레이션 하에서의 정책 학습은 보류된 데이터 평가 및 사용자 연구 모두에서 오디오 수준 시뮬레이션과 유사한 성능을 기록하며, 사용자 평가 기준 대화 품질에 유의미한 차이가 없다.
  • 사용자 연구 평가에 대한 이원분산분석(ANOVA) 결과, 상호작용 효과가 유의미하지 않음(p = 0.076)으로 나타나, 두 시뮬레이션 기법이 사용자 인식 품질 측면에서 유사한 성능을 낸다는 것을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.