Skip to main content
QUICK REVIEW

[논문 리뷰] Romanian Speech Recognition Experiments from the ROBIN Project

Andrei-Marius Avram, Vasile Păiș|arXiv (Cornell University)|2021. 11. 23.
Speech and dialogue systems참고 문헌 34인용 수 5
한 줄 요약

이 논문은 저지연, 고정확도의 딥 뉴럴 네트워크 기반 자동 음성 인식(ASR) 시스템을 로마니아어에 적용하여 언어 모델을 사용할 경우 9.91%의 단어 오류률(WER)을 달성하면서도 인fer런스 지연을 100ms 이내로 유지한다. 이 작업은 하이픈, 문장 기능, 알 수 없는 단어 보정을 위한 모듈러한 후처리 구성 요소를 통합하고, 로봇 대화 응용 프로그램을 위한 실시간 웹 기반 음성 인식을 지원하기 위해 RELATE 플랫폼을 통해 API 기반으로 시스템을 구현한다.

ABSTRACT

One of the fundamental functionalities for accepting a socially assistive robot is its communication capabilities with other agents in the environment. In the context of the ROBIN project, situational dialogue through voice interaction with a robot was investigated. This paper presents different speech recognition experiments with deep neural networks focusing on producing fast (under 100ms latency from the network itself), while still reliable models. Even though one of the key desired characteristics is low latency, the final deep neural network model achieves state of the art results for recognizing Romanian language, obtaining a 9.91% word error rate (WER), when combined with a language model, thus improving over the previous results while offering at the same time an improved runtime performance. Additionally, we explore two modules for correcting the ASR output (hyphen and capitalization restoration and unknown words correction), targeting the ROBIN project's goals (dialogue in closed micro-worlds). We design a modular architecture based on APIs allowing an integration engine (either in the robot or external) to chain together the available modules as needed. Finally, we test the proposed design by integrating it in the RELATE platform and making the ASR service available to web users by either uploading a file or recording new speech.

연구 동기 및 목표

  • 로봇 상호작용을 위한 실시간 적용에 적합한 빠르고 정확한 로마니아어 자동 음성 인식 시스템을 개발하기 위해.
  • 정확도를 희생시키지 않은 채 인fer런스 지연을 100ms 이내로 유지하기 위해.
  • 최적화된 딥 뉴럴 네트워크 아키텍처와 언어 모델링을 통해 이전의 로마니아어 ASR 성능을 향상시키기 위해.
  • 폐쇄 도메인 대화 시스템에서 ASR 출력 품질을 향상시키기 위해 모듈러한 후처리 구성 요소를 설계하기 위해.
  • 로봇 플랫폼인 ROBIN과 같은 시스템에 통합 가능하도록 모듈러하고 API 기반 아키텍처를 설계하여 외부 통합을 가능하게 하기 위해.

제안 방법

  • 정확도와 저지연 인fer런스를 동시에 최적화하기 위해 로마니아어 음성 데이터 기반의 딥 뉴럴 네트워크(DNN) 음향 모델을 훈련시키기 위해.
  • DNN 출력에 언어 모델을 적용하여 단어 오류률을 감소시키고 맥락 이해를 향상시키기 위해.
  • 하이픈 복원, 문장 기능 복원, 알 수 없는 단어 보정을 위한 별도의 API를 포함한 모듈러한 파이프라인 설계하기 위해.
  • 웹 인터페이스를 통한 파일 업로드 및 실시간 음성 녹음 기능을 지원하기 위해 ASR 시스템을 RELATE 플랫폼에 통합하기 위해.
  • 각 처리 단계(ASR, 후처리)가 API를 통해 호출 가능한 서비스로 노출되는 분리된 아키텍처를 사용하기 위해.
  • 폐쇄된 마이크로 월드 환경에서 로봇 대화를 시뮬레이션하는 통제된 환경에서 종단 간 시스템 평가하기 위해.

실험 결과

연구 질문

  • RQ1로마니아어 기반의 딥 뉴럴 네트워크 기반 ASR 시스템이 100ms 이내의 지연으로 최신 기술 수준의 성능을 달성할 수 있는가?
  • RQ2모듈러한 후처리 구성 요소(하이픈 복원, 문장 기능 복원, 알 수 없는 단어 보정)가 폐쇄 도메인 로봇 대화 환경에서 ASR 출력 품질 향상에 얼마나 효과적인가?
  • RQ3RELATE와 같은 플랫폼에 ASR 시스템을 통합함으로써 로봇 응용 프로그램을 위한 실시간 웹 액세스 가능한 음성 인식이 얼마나 잘 가능해지는가?
  • RQ4언어 모델링이 로마니아어 ASR 출력의 최종 단어 오류률에 어떤 영향을 미치는가?
  • RQ5모듈러하고 API 기반의 설계 방식이 로봇 또는 외부 시스템에 대한 확장성과 통합을 얼마나 잘 지원하는가?

주요 결과

  • 제안된 DNN 기반 ASR 시스템은 언어 모델을 결합할 경우 9.91%의 단어 오류률을 기록하여 로마니아어 음성 인식 분야에서 최신 기술 수준의 성능을 달성한다.
  • 시스템은 인fer런스 지연을 100ms 이내로 유지하여 상호작용 기반 로봇 응용 프로그램의 실시간 요구 조건을 충족시킨다.
  • 모듈러한 후처리 파이프라인은 특히 통제된 대화 환경에서 ASR 출력의 난이도와 정확도를 크게 향상시킨다.
  • ASR 서비스가 RELATE 플랫폼에 통합되어 웹 클라이언트에서 파일 기반 및 실시간 음성 입력을 모두 지원한다.
  • API 기반 아키텍처는 처리 모듈의 탄력적 조합을 가능하게 하여, 로봇 또는 외부 대화 시스템에 동적 통합을 지원한다.
  • 결과적으로 고정확도와 저지연이 동시에 달성 가능함을 입증하여 사회적 보조 로봇 분야에서 실용적인 구현이 가능함을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.