Skip to main content
QUICK REVIEW

[논문 리뷰] Implementation of an Automatic Syllabic Division Algorithm from Speech Files in Portuguese Language

E. L. F. Da Silva, H. M. de Oliveira|arXiv (Cornell University)|2015. 01. 29.
Speech Recognition and Synthesis참고 문헌 9인용 수 4
한 줄 요약

이 논문은 포르투갈어 말하기에서 음성 신호의 에너지 포락선을 사용하여 자동 음절 분할을 위한 새로운 계산 효율적인 알고리즘을 제시한다. MATLAB로 구현된 이 알고리즘은 진폭 포락선의 국부적 최댓값과 최솟값을 식별하여 음절 경계를 탐지하며, 50단어 테스트 세트에서 약 70%의 정확도를 달성했으며 임베디드 시스템이나 음성병리 진단 도구에 통합될 수 있는 잠재력이 있다.

ABSTRACT

A new algorithm for voice automatic syllabic splitting in the Portuguese language is proposed, which is based on the envelope of the speech signal of the input audio file. A computational implementation in MatlabTM is presented and made available at the URL http://www2.ee.ufpe.br/codec/divisao_silabica.html. Due to its straightforwardness, the proposed method is very attractive for embedded systems (e.g. i-phones). It can also be used as a screen to assist more sophisticated methods. Voice excerpts containing more than one syllable and identified by the same envelope are named as super-syllables and they are subsequently separated. The results indicate which samples corresponds to the beginning and end of each detected syllable. Preliminary tests were performed to fifty words at an identification rate circa 70% (further improvements may be incorporated to treat particular phonemes). This algorithm is also useful in voice command systems, as a tool in the teaching of Portuguese language or even for patients with speech pathology.

연구 동기 및 목표

  • 포르투갈어 음성 신호를 위한 저복잡도, 실시간 음절 분할 알고리즘 개발
  • 음성 파일을 음절 단위로 자동 분할하기 위해 진폭 포락선 분석만을 사용하는 것 목표
  • 음성 명령 시스템, 언어 교육, 음성병리 평가 응용 분야 지원
  • 더 복잡한 음절 분할 또는 음성 인식 파ip라인의 빠른 사전처리 단계 제공
  • 스마트폰과 같은 자원 제약이 있는 장치에 배포 가능한 알고리즘 제공

제안 방법

  • 알고리즘은 음절 시작과 종료에 해당하는 진폭 포락선의 변조를 탐지하기 위해 입력 음성 신호의 포락선을 분석한다.
  • 지속적인 에너지 영역을 탐지하여 다수의 음절을 포함하는 단일 포락선 형태를 띤 '슈퍼-음절'을 식별한다.
  • 진폭 임계값 설정과 영점 통과 검출을 사용하여 포락선 내 局부 최솟값과 최댓값을 식별함으로써 음절 경계를 결정한다.
  • 음절 피크를 탐지하기 위해 피크 검출 알고리즘을 적용하고, 에너지 기반 분할을 통해 개별 음절을 분리한다.
  • 구현은 MATLAB로 작성되었으며 재현성과 다른 시스템에의 통합을 위해 공개되었다.
  • 알고리즘은 경량이며 임베디드 플랫폼에서 실시간 처리에 적합하도록 설계되었다.

실험 결과

연구 질문

  • RQ1음성학적 또는 음향 모델링 없이도 단순한 포락선 기반 방법이 포르투갈어에서 신뢰할 수 있는 음절 분할을 달성할 수 있는가?
  • RQ2연속된 말하기에서 진폭 포락선 특징만을 사용할 때 음절 경계를 얼마나 정확하게 탐지할 수 있는가?
  • RQ3이 알고리즘이 포르투갈어에서의 겹치는 음절이나 복잡한 음소 환경을 어느 정도 잘 처리할 수 있는가?
  • RQ4더 고급 음성 처리 시스템의 사전 처리 필터로 효과적으로 사용될 수 있는가?
  • RQ5이러한 저복잡도 접근 방식의 음절 분할 정확도에 대한 성능 한계는 무엇인가?

주요 결과

  • 알고리즘은 포르투갈어 음성 파일의 음절 경계를 진폭 포락선만을 사용하여 성공적으로 식별하였으며, 50단어 테스트 세트에서 약 70%의 초도 식별률을 달성했다.
  • 단일 포락선 형태를 띤 '슈퍼-음절'을 탐지하여 이후에 더 작은 단위로 분할할 수 있도록 했다.
  • 이 방법의 계산적 단순성 덕분에 스마트폰과 같은 임베디드 시스템에 배포하기에 적합하다.
  • 더 복잡한 음절 분할 또는 음성 인식 시스템의 강력한 프론트엔드 필터로 기능할 수 있다.
  • 결과는 포락선 기반 분석이 포르투갈어에서 음절 분할을 위한 충분한 시간적 구조를 포착할 수 있음을 시사한다.
  • 특정 음소가 포락선 형태에 영향을 주는 점을 보완함으로써 향후 개선이 가능할 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.