Skip to main content
QUICK REVIEW

[論文レビュー] Implementation of an Automatic Syllabic Division Algorithm from Speech Files in Portuguese Language

E. L. F. Da Silva, H. M. de Oliveira|arXiv (Cornell University)|Jan 29, 2015
Speech Recognition and Synthesis参考文献 9被引用数 4
ひとこと要約

本論文では、音声信号のエンベロープを用いてポルトガル語の音節分割を自動的に行う、計算効率に優れた新規アルゴリズムを提示する。MATLABで実装され、振幅エンベロープのピークと谷を特定することで音節境界を検出する。50語のテストセットで約70%の正確性を達成し、組み込みシステムや言語障害評価ツールへの統合が可能である。

ABSTRACT

A new algorithm for voice automatic syllabic splitting in the Portuguese language is proposed, which is based on the envelope of the speech signal of the input audio file. A computational implementation in MatlabTM is presented and made available at the URL http://www2.ee.ufpe.br/codec/divisao_silabica.html. Due to its straightforwardness, the proposed method is very attractive for embedded systems (e.g. i-phones). It can also be used as a screen to assist more sophisticated methods. Voice excerpts containing more than one syllable and identified by the same envelope are named as super-syllables and they are subsequently separated. The results indicate which samples corresponds to the beginning and end of each detected syllable. Preliminary tests were performed to fifty words at an identification rate circa 70% (further improvements may be incorporated to treat particular phonemes). This algorithm is also useful in voice command systems, as a tool in the teaching of Portuguese language or even for patients with speech pathology.

研究の動機と目的

  • ポルトガル語音声信号向けに低複雑性でリアルタイム処理が可能な音節分割アルゴリズムの開発。
  • 音声ファイルの自動セグメンテーションを、振幅エンベロープ解析のみを用いて実現。
  • 音声コマンドシステム、言語教育、および言語障害評価アプリケーションへの支援。
  • より複雑な音節分割または音声認識パイプラインの前処理ステップとしての高速処理を提供。
  • スマートフォンなどのリソース制限のあるデバイスへのデプロイを可能にする。

提案手法

  • アルゴリズムは、入力音声信号のエンベロープを分析し、音節の開始と終了に対応する振幅変調を検出する。
  • 持続的なエネルギー領域を検出することで、複数の音節を含む「スーパー音節」—1つのエンベロープ・コントゥアを有するセグメント—を特定する。
  • 局所的な最小値と最大値をエンベロープ上で特定することで音節境界を決定し、振幅しきい値とゼロ交差検出を用いる。
  • 音節ピークを特定するためのピーク検出アルゴリズムを採用し、エネルギーに基づくセグメンテーションを適用して個々の音節を分離する。
  • 実装はMATLABで記述され、再現可能性および他のシステムへの統合を目的に公開されている。
  • アルゴリズムは軽量であり、組み込みプラットフォームでのリアルタイム処理に適している。

実験結果

リサーチクエスチョン

  • RQ1音声学的または音声モデルを用いずに、単純なエンベロープベースの手法がポルトガル語で信頼性のある音節セグメンテーションを達成できるか?
  • RQ2連続音声において、振幅エンベロープ特徴のみを用いて音節境界をどの程度正確に検出できるか?
  • RQ3この手法が、ポルトガル語における重複音節や複雑な音声的環境をどの程度処理できるか?
  • RQ4より高度な音声処理システムの前処理フィルタとして、この手法が効果的に使用できるか?
  • RQ5このような低複雑性アプローチの音節分割正確性の上限はどの程度か?

主な発見

  • アルゴリズムは、振幅エンベロープのみを用いてポルトガル語音声ファイルの音節境界を効果的に特定し、50語のテストセットで概ね70%の初期識別率を達成した。
  • 「スーパー音節」—1つのエンベロープ・コントゥアを有するが複数の音節を含むセグメント—を検出でき、その後の分割処理を可能にした。
  • アプローチの計算的単純さのおかげで、スマートフォンなどの組み込みシステムへのデプロイに適している。
  • より複雑な音節分割または音声認識システムの強力なフロントエンド・フィルタとして機能できる。
  • 結果から、エンベロープベースの解析がポルトガル語の音節セグメンテーションに十分な時間的構造を捉えられると示唆された。
  • 特定の音素がエンベロープの形状に与える影響を精緻に処理することで、さらなる改善が可能である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。