Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Speech Rate in Speech Recognition

Xiangyu Zeng, Shi Yin|arXiv (Cornell University)|2015. 06. 02.
Speech Recognition and Synthesis참고 문헌 11인용 수 3
한 줄 요약

이 논문은 음성 인식에서 비정상적으로 느리거나 빠른 음성 속도(ROS)로 인한 스펙트럼 왜곡을 보완하기 위해 ROS를 입력 특징으로 포함시켜 DNN 기반 접근법을 제안한다. 이로써 모델은 비정상적인 음성 속도로 인한 스펙트럼 왜곡을 학습하고 보완할 수 있다. 이 방법은 정상 속도의 음성 인식 성능을 떨어뜨리지 않으면서 느린 음성과 빠른 음성 양쪽에서 일관된 성능 향상을 이룬다. 또한 HMM 전이 적응과 조합할 경우 추가적인 향상이 이루어지며, 이는 ROS가 음성 신호의 시간적 및 스펙트럼적 성질에 영향을 준다는 것을 확인시킨다.

ABSTRACT

A significant performance reduction is often observed in speech recognition when the rate of speech (ROS) is too low or too high. Most of present approaches to addressing the ROS variation focus on the change of speech signals in dynamic properties caused by ROS, and accordingly modify the dynamic model, e.g., the transition probabilities of the hidden Markov model (HMM). However, an abnormal ROS changes not only the dynamic but also the static property of speech signals, and thus can not be compensated for purely by modifying the dynamic model. This paper proposes an ROS learning approach based on deep neural networks (DNN), which involves an ROS feature as the input of the DNN model and so the spectrum distortion caused by ROS can be learned and compensated for. The experimental results show that this approach can deliver better performance for too slow and too fast utterances, demonstrating our conjecture that ROS impacts both the dynamic and the static property of speech. In addition, the proposed approach can be combined with the conventional HMM transition adaptation method, offering additional performance gains.

연구 동기 및 목표

  • 비정상적으로 낮거나 높은 음성 속도로 인한 음성 인식 성능 저하 문제를 해결하기 위해.
  • 음성 속도 변동이 음성 신호의 시간적(동적) 성질 뿐 아니라 스펙트럼적(정적) 성질에도 영향을 미치는지 조사하기 위해.
  • 음성 속도 변동으로 인한 스펙트럼 왜곡을 학습하고 보정하는 DNN 기반 보완 방법을 개발하기 위해.
  • DNN 기반 스펙트럼 보완과 전통적인 HMM 전이 적응을 조합했을 때 상호보완적인 성능 향상이 이루어지는지 입증하기 위해.

제안 방법

  • DNN 음성 모델에 추가 입력 특징으로 음성 속도(RoS)를 도입하여, 네트워크가 ROS에 의존하는 패tern을 학습할 수 있도록 한다.
  • ROS 값을 입력으로 사용하여 지도 학습 방식으로 DNN 모델을 훈련시켜, 극단적인 음성 속도로 인한 스펙트럼 왜곡을 학습하고 보완하도록 한다.
  • 이산적인 카테고리(예: 느림/빠름)가 아닌 연속적인 ROS 값을 입력으로 사용함으로써, 다양한 음성 속도 간의 매끄러운 파라미터 공유와 더 효율적인 데이터 활용이 가능하다.
  • HMM 전이 구조를 수정하지 않고도 표준 DNN 음성 모델링 프레임워크 내에서 DNN 기반 ROS 보완을 구현한다.
  • DNN 기반 보완을 전통적인 HMM 전이 적응(예: 자기 전이 확률 조정)과 조합하여 스펙트럼적 왜곡과 시간적 왜곡을 동시에 보완한다.
  • 극단적인 ROS(느림: <6 phonemes/초, 빠름: >6 phonemes/초)를 포함한 테스트 세트에서 성능을 평가하고, GMM 및 DNN 베이스라인과 비교한다.

실험 결과

연구 질문

  • RQ1음성 속도 변동은 음소 단위의 지속 시간 뿐 아니라 음성 신호의 스펙트럼 특성에도 영향을 미치는가?
  • RQ2DNN 기반 음성 모델은 비정상적인 음성 속도로 인한 스펙트럼 왜곡을 효과적으로 학습하고 보완할 수 있는가?
  • RQ3DNN 기반 ROS 보완으로 얻는 성능 향상은 HMM 전이 적응과 독립적인가, 아니면 상호보완적인가?
  • RQ4연속적인 ROS를 입력 특징으로 포함시키면 이산적 분류보다 더 나은 일반화 성능을 얻을 수 있는가?
  • RQ5제안된 방법은 정상 속도 음성 인식 성능을 해치지 않으면서 느린 음성과 빠른 음성 양쪽에서 인식 정확도를 향상시킬 수 있는가?

주요 결과

  • DNN 기반 ROS 보완 방법은 느린 음성과 빠른 음성 양쪽에서 인식 성능을 크게 향상시켰다. 매우 느린 음성(<4 phonemes/초)에서는 WER이 45.71%에서 44.92%로 감소했고, 매우 빠른 음성(>10 phonemes/초)에서는 31.22%에서 29.54%로 감소했다.
  • HMM 기반 전이 적응 방법은 빠른 음성에서 성능 향상을 이뤘다(31.22%에서 30.13% WER로 감소) 하지만 느린 음성에서는 성능 향상이 이루어지지 않아, 느린 음성의 성능 저하가 시간적 왜곡 때문만은 아님을 시사한다.
  • DNN 기반 스펙트럼 보완과 HMM 기반 시간적 적응을 조합하면 추가적인 성능 향상이 이루어졌으며, 빠른 음성에서 WER이 29.08%로 감소했다. 이는 ROS 변동이 스펙트럼적 왜곡과 시간적 왜곡을 모두 유발한다는 것을 확인시킨다.
  • 오직 느린 또는 빠른 음성 데이터만으로 훈련하면, 매칭되지 않는 테스트 세트에서 성능 저하가 심각하게 발생함을 확인했으며, 이는 훈련 데이터에 다양한 ROS가 포함되어야 함을 강조한다.
  • DNN 기반 방법은 정상 속도 음성 인식 성능을 해치지 않으면서 모든 ROS 조건에서 성능 향상을 이뤘으며, 이는 그 방법의 강건성과 일반화 능력을 입증한다.
  • 결과는 ROS가 음성 신호의 동적(시간적) 성질과 정적(스펙트럼적) 성질에 모두 영향을 미치며, 스펙트럼 왜곡은 HMM 적응만으로는 보정될 수 없다는 것을 확인시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.