[論文レビュー] Hybridized Feature Extraction and Acoustic Modelling Approach for Dysarthric Speech Recognition
本論文は、遺伝的アルゴリズムを用いて最適化されたハイブリッド特徴抽出および音声モデル化手法を提案し、ジンシュウスリュウド発話のための自動音声認識(ASR)を向上させることを目的としている。16個の音声特徴を最適化することで、訓練時間5:30:17で98.28%の認識率を達成し、従来手法に比べ顕著な性能向上を実現した。
Dysarthria is malfunctioning of motor speech caused by faintness in the human nervous system. It is characterized by the slurred speech along with physical impairment which restricts their communication and creates the lack of confidence and affects the lifestyle. This paper attempt to increase the efficiency of Automatic Speech Recognition (ASR) system for unimpaired speech signal. It describes state of art of research into improving ASR for speakers with dysarthria by means of incorporated knowledge of their speech production. Hybridized approach for feature extraction and acoustic modelling technique along with evolutionary algorithm is proposed for increasing the efficiency of the overall system. Here number of feature vectors are varied and tested the system performance. It is observed that system performance is boosted by genetic algorithm. System with 16 acoustic features optimized with genetic algorithm has obtained highest recognition rate of 98.28% with training time of 5:30:17.
研究の動機と目的
- ジンシュウスリュウド発話者、すなわち運動性発話障害に起因するコミュニケーション課題を抱える人々の自動音声認識(ASR)性能を向上させること。
- 従来のASRシステムがジンシュウスリュウド発話を処理する際の限界、特にだらだらとした発音や聞き取りにくさを是正すること。
- 分類的最適化を用いた特徴抽出と音声モデル化のハイブリッドアプローチを開発し、認識正確性を向上させること。
- 遺伝的アルゴリズムを用いた特徴選択と最適化により、特徴ベクトルの次元数がシステム性能に与える影響を評価すること。
提案手法
- 複数の音声特徴を統合するハイブリッド特徴抽出法を用い、ジンシュウスリュウド発話の特徴をよりよく表現する。
- 16個の音声特徴の選択と重み付けを最適化するために遺伝的アルゴリズムを採用し、システムの頑健性と認識正確性を向上させた。
- ジンシュウスリュウド発話データで訓練された最新のASRフレームワークを用いて音声モデル化を実施した。
- 特徴ベクトルの次元数を体系的に変化させ、認識性能に最適な構成を特定するためのテストを実施した。
- 進化的計算を用いて特徴空間を効率的に探索し、反復的最適化によって誤差率を最小化した。
- 一般化と頑健性を確保するため、大規模なジンシュウスリュウド発話データセットを用いて訓練を実施した。
実験結果
リサーチクエスチョン
- RQ1従来手法と比較して、ハイブリッド特徴抽出および音声モデル化アプローチはジンシュウスリュウド発話のASR性能を向上させることができるか?
- RQ2音声特徴の数がジンシュウスリュウド発話認識の正確性に与える影響は何か?
- RQ3遺伝的アルゴリズムが特徴選択をどれほど最適化できるか、その影響は何か?
- RQ4ジンシュウスリュウド発話者向けに認識正確性を最大化する最適な特徴構成は何か?
- RQ5特徴集合のサイズと最適化の複雑さに応じて、訓練時間はどのようにスケーリングされるか?
主な発見
- 最適化された16個の音声特徴を用いたシステムは、98.28%の認識率を達成し、本研究で報告された最高性能を示した。
- 遺伝的アルゴリズムにより、関連する音声特徴の効果的な選択と重み付けがなされ、システム性能が顕著に向上した。
- 最適な構成(16特徴)の訓練時間は5時間30分17秒であり、計算コストとして実用的であることが示された。
- 特徴ベクトルの次元数が16に達するまで認識性能が向上したが、以降はさらなる向上が得られなかった。
- ハイブリッドアプローチはベースラインシステムを上回り、発話生成に関するドメイン固有の知識と進化的最適化を統合する有効性を示した。
- 遺伝的アルゴリズムによる特徴最適化は、ジンシュウスリュウド発話におけるASRの頑健性を向上させる実用的戦略であると確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。