Skip to main content
QUICK REVIEW

[논문 리뷰] Automatic recognition of child speech for robotic applications in noisy environments

Samuel Fernando, Roger K. Moore|arXiv (Cornell University)|2016. 11. 08.
Speech and dialogue systems참고 문헌 11인용 수 8
한 줄 요약

이 논문은 Kaldi 툴킷 내에서 깊이 신경망(DNNs)과 실시간 언어 모델 적응을 활용하여 소음 환경에서의 어린이-로봇 상호작용을 위한 강건한 자동 음성 인식(ASR) 시스템을 제시한다. 실시간 박물관 운영 동안 320명의 어린이를 대상으로 유창하고 어휘에 속하는 어린이 음성에서 90%의 정확도를 달성하였으며, 데이터 증강과 동적 대화 통합을 통해 소음과 발화자 변동성에 대한 강건성을 입증하였다.

ABSTRACT

Automatic speech recognition (ASR) allows a natural and intuitive interface for robotic educational applications for children. However there are a number of challenges to overcome to allow such an interface to operate robustly in realistic settings, including the intrinsic difficulties of recognising child speech and high levels of background noise often present in classrooms. As part of the EU EASEL project we have provided several contributions to address these challenges, implementing our own ASR module for use in robotics applications. We used the latest deep neural network algorithms which provide a leap in performance over the traditional GMM approach, and apply data augmentation methods to improve robustness to noise and speaker variation. We provide a close integration between the ASR module and the rest of the dialogue system, allowing the ASR to receive in real-time the language models relevant to the current section of the dialogue, greatly improving the accuracy. We integrated our ASR module into an interactive, multimodal system using a small humanoid robot to help children learn about exercise and energy. The system was installed at a public museum event as part of a research study where 320 children (aged 3 to 14) interacted with the robot, with our ASR achieving 90% accuracy for fluent and near-fluent speech.

연구 동기 및 목표

  • 소음이 많은 실제 환경(예: 교실)에서 어린이-로봇 상호작용을 위한 강건한 ASR 시스템을 개발하는 것.
  • 음역 구조의 차이, 발음 변동성, 불순화된 발화 등 어린이 음성 인식의 과제를 극복하는 것.
  • 데이터 증강과 깊이 신경망(DNN) 음향 모델을 활용해 소음 조건에서의 ASR 성능을 향상시키는 것.
  • 멀티모odal 대화 시스템과 동적으로 통합하여 대화 맥락에 기반해 실시간으로 언어 모델을 업데이트하는 ASR 모듈 통합.
  • 3세에서 14세 어린이를 대상으로 실생활 박물관 환경에서 시스템을 평가하는 것.

제안 방법

  • 기존 GMM 방법에 비해 최신 기술의 깊이 신경망(DNN) 음향 모델을 활용한 Kaldi 툴킷 기반 ASR 모듈을 구현.
  • 한정된 훈련 데이터를 고려할 때 특히 중요한 배경 소음과 발화자 변동성에 대한 강건성을 향상시키기 위해 데이터 증강 기법을 적용.
  • 현재 대화 단계(예: 퀴즈 옵션)에 기반해 언어 모델을 실시간으로 업데이트할 수 있도록 대화 시스템과 ASR 모듈을 통합하여 정확도 향상.
  • 온라인(실시간) 운영을 위해 설계하여 상호작용형 로봇 응용 프로그램에서 실시간 음성 인식과 저지연 응답을 가능하게 함.
  • 음성 경계를 식별하기 위해 종료점 탐지 및 세그먼테이션 히우리스틱을 사용하였지만, 수동 분석 결과 후행 평가에서 세그먼테이션 오류가 확인됨.
  • 실생활 박물관 환경에서 시스템을 구현하여 인간형 로봇과 상호작용한 320명의 어린이로부터 데이터를 수집.

실험 결과

연구 질문

  • RQ1DNN 기반 ASR 시스템은 소음이 많은 교실 환경에서 어린이의 유창한 음성 인식에 높은 정확도를 달성할 수 있는가?
  • RQ2실시간 언어 모델 적응은 어린이-로봇 대화 시스템의 인식 성능을 어떻게 향상시키는가?
  • RQ3데이터 증강 기법은 얼마나 어린이 음성 인식에서 소음과 발화자 변동성에 대한 강건성을 향상시키는가?
  • RQ4실시간 어린이-로봇 상호작용에서 세그먼테이션 오류의 주요 원인은 무엇이며, 이는 정확도에 어떤 영향을 미치는가?
  • RQ5실생활 구현에서 시스템 성능은 다양한 연령 및 성별 집단 간에 어떻게 달라지는가?

주요 결과

  • 소음이 많은 박물관 환경에서 실시간 상호작용 중에 어린이의 유창하고 어휘에 속하는 발화에 대해 ASR 시스템은 90%의 정확도를 달성하였다.
  • 가장 흔한 세그먼테이션 오류는 '조기 시작'이었으며, 주로 로봇의 음성에서 다시 읽는 것에 기인하여 음성 경계 탐지 시점 오류를 시사하였다.
  • '조기 종료' 오류율은 비교적 낮았으며(116건), 이는 시스템의 저지연성 덕분에 신속한 인식이 가능했음을 의미하며, 상호작용형 로봇 대화에 유리하다.
  • '지연 종료' 오류(115건)는 주로 ASR 인식 실패와 관련되어 대화 관리자 타임아웃과 조기 로봇 응답을 유도하였다.
  • 제한된 훈련 데이터에도 불구하고 시스템은 뛰어난 성능를 보였으며, 이는 데이터 증강과 DNN 기반 음향 모델링의 효과를 입증하였다.
  • 수동 전사 분석을 통해 대부분의 인식 오류가 유창한 발화에서 단어 인식 오류가 아니라 세그먼테이션의 잘못된 정렬 때문임을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.