Skip to main content
QUICK REVIEW

[논문 리뷰] Speech Recognition of the letter 'zha' in Tamil Language using HMM

A. Srinivasan, K. Srinivasa Rao|arXiv (Cornell University)|2010. 01. 23.
Speech and Audio Processing참고 문헌 2인용 수 4
한 줄 요약

이 논문은 LPC 처리된 음성 신호로 훈련된 1차 순서 3상태 음성 마크로프로세스 모델(HMM)을 사용하여 타밀 문자 'zha'의 음성 인식 시스템을 제안한다. 파형 서퍼 도구를 활용하여 비트레이트를 128 kbps에서 15.45 kbps로 현저히 감소시키면서도 인식 성능를 유지함으로써, 저비트레이트 타밀 음성 처리에서 HMM 기반의 음소 인식의 실현 가능성을 입증한다.

ABSTRACT

Speech signals of the letter 'zha' in Tamil language of 3 males and 3 females were coded using an improved version of Linear Predictive Coding (LPC). The sampling frequency was at 16 kHz and the bit rate was at 15450 bits per second, where the original bit rate was at 128000 bits per second with the help of wave surfer audio tool. The output LPC cepstrum is implemented in first order three state Hidden Markov Model(HMM) chain.

연구 동기 및 목표

  • 언어 특화 음성 처리를 지원하기 위해 타밀 음소 'zha'를 대상으로 저비트레이트 음성 인식 시스템을 개발하기 위해.
  • 향상된 선형 예측 코딩(LPC)을 활용하여 타밀 음성 신호의 비트레이트를 128 kbps에서 더 효율적인 15.45 kbps로 감소시키기 위해.
  • 남성 및 여성 화자로부터의 'zha' 음소를 인식하기 위해 1차 순서 3상태 HMM의 성능을 평가하기 위해.
  • HMM 기반 음소 인식에서 LPC 켈스트럼 특징의 효과를 입증하기 위해.
  • 인도 언어의 저대역폭 음성 인식 시스템에 적용 가능한 모델을 기여하기 위해.

제안 방법

  • 타밀 문자 'zha'의 음성 신호는 16 kHz 샘플링 주파수로 3명의 남성 및 3명의 여성 화자로부터 기록되었다.
  • 향상된 선형 예측 코딩(LPC)이 적용되어 음성 신호를 압축하고 LPC 켈스트럼 특징을 추출하였다.
  • LPC 켈스트럼 출력은 음소의 동적 특성을 표현하기 위해 1차 순서 3상태 음성 마크로프로세스 모델(HMM)로 모델링되었다.
  • 파형 서퍼 도구를 사용하여 비트레이트를 128,000 bps에서 15,450 bps로 감소시켰다.
  • HMM은 LPC 분석에서 유도된 켈스트럼 계수를 기반으로 훈련 및 테스트되었다.
  • 시스템은 6명의 화자(남성 3명, 여성 3명)로 구성된 데이터셋을 사용하여 인식 정확도와 압축 효율성을 평가하기 위해 평가되었다.

실험 결과

연구 질문

  • RQ1저비트레이트 LPC 기반 표현이 타밀 음소 'zha'의 음향적 특징을 효과적으로 포착할 수 있는가?
  • RQ21차 순서 3상태 HMM은 'zha' 음소의 시간적 동적 특성을 얼마나 효과적으로 모델링하는가?
  • RQ3인식 성능을 훼손시키지 않으면서 비트레이트를 어느 정도까지 감소시킬 수 있는가?
  • RQ4남성 및 여성 화자의 'zha' 음소 특징은 LPC 및 HMM 모델링 측면에서 어떻게 비교되는가?
  • RQ5제안된 HMM-LPC 프레임워크는 타밀어 저대역폭 음성 인식에 실현 가능한가?

주요 결과

  • LPC 및 파형 서퍼를 활용하여 비트레이트를 128,000 bps에서 15,450 bps로 성공적으로 감소시켰으며, 이는 약 8.3:1의 압축 비율을 기록하였다.
  • 1차 순서 3상태 HMM 모델은 남성 및 여성 화자 모두에서 'zha' 음소 인식에 안정적인 성능을 보였다.
  • LPC 켈스트럼 특징은 'zha' 음소의 스펙트럼 엔벨롭을 효과적으로 표현하여 신뢰할 수 있는 HMM 훈련을 가능하게 하였다.
  • 심한 데이터 압축에도 불구하고 시스템은 인식 능력을 유지하였으며, 이는 HMM-LPC 파이프라인의 강건성을 시사한다.
  • 결과적으로 제안된 방법은 타밀어 및 유사 언어의 저비트레이트 음성 인식 응용 분야에 적합하다는 것을 시사한다.
  • 본 연구는 인도어에서 고립 음소 인식에 HMM을 LPC 유도 특징과 함께 사용하는 것이 실현 가능하다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.