[논문 리뷰] Hybridized Feature Extraction and Acoustic Modelling Approach for Dysarthric Speech Recognition
이 논문은 자동 음성 인식(ASR) 성능을 향상시키기 위해 유전 알고리즘을 활용한 하이브리드 특징 추출 및 음향 모델링 접근법을 제안한다. 16개의 음향 특징을 최적화함으로써, 학습 시간이 5:30:17인 동안 98.28%의 인식률을 달성하여 기존 방법에 비해 성능을 크게 향상시켰다.
Dysarthria is malfunctioning of motor speech caused by faintness in the human nervous system. It is characterized by the slurred speech along with physical impairment which restricts their communication and creates the lack of confidence and affects the lifestyle. This paper attempt to increase the efficiency of Automatic Speech Recognition (ASR) system for unimpaired speech signal. It describes state of art of research into improving ASR for speakers with dysarthria by means of incorporated knowledge of their speech production. Hybridized approach for feature extraction and acoustic modelling technique along with evolutionary algorithm is proposed for increasing the efficiency of the overall system. Here number of feature vectors are varied and tested the system performance. It is observed that system performance is boosted by genetic algorithm. System with 16 acoustic features optimized with genetic algorithm has obtained highest recognition rate of 98.28% with training time of 5:30:17.
연구 동기 및 목표
- 운동성 말장애로 인해 의사소통에 어려움을 겪는 이석성 말하기 환자를 위한 자동 음성 인식(ASR) 성능을 향상시키기 위해.
- 일반적인 ASR 시스템이 이석성 말하기의 특징인 뚜렷하지 않은 발음과 감소된 이해 가능성으로 인해 성능에 한계를 보이는 문제를 해결하기 위해.
- 특징 추출과 음향 모델링을 융합한 하이브리드 접근법을 개발하고, 진화 최적화 기법을 적용하여 인식 정확도를 향상시키기 위해.
- 특징 벡터 차원 수의 변화가 시스템 성능에 미치는 영향을 평가하기 위해, 특징 선택 및 최적화에 유전 알고리즘을 활용한다.
제안 방법
- 다양한 음향 특징을 조합하여 이석성 말하기의 특성을 더 잘 반영할 수 있도록 하이브리드 특징 추출 방법을 사용한다.
- 16개의 음향 특징의 선택과 가중치를 최적화하기 위해 유전 알고리즘을 적용하여 시스템의 강건성과 인식 정확도를 향상시킨다.
- 이석성 말하기 데이터로 훈련된 최신 기술 기반의 ASR 프레임워크를 사용해 음향 모델링을 수행한다.
- 특징 벡터의 차원을 체계적으로 변화시켜 최적의 구성이 인식 성능에 미치는 영향을 평가한다.
- 반복적인 최적화를 통해 오차율을 최소화할 수 있도록 효율적으로 특징 공간을 탐색하기 위해 진화 계산 기법을 사용한다.
- 일반화와 강건성을 확보하기 위해 대규모 이석성 말하기 음성 데이터셋을 사용해 학습을 수행한다.
실험 결과
연구 질문
- RQ1기존 방법에 비해 하이브리드 특징 추출 및 음향 모델링 접근법이 이석성 말하기의 ASR 성능을 향상시킬 수 있는가?
- RQ2음향 특징의 수가 이석성 말하기 인식 정확도에 어떤 영향을 미치는가?
- RQ3유전 알고리즘이 특징 선택을 얼마나 효과적으로 최적화하여 인식률을 향상시킬 수 있는가?
- RQ4이석성 말하기 환자에게 최대 인식 정확도를 달성하기 위한 최적의 음향 특징 조합은 무엇인가?
- RQ5특징 집합 크기와 최적화 복잡도가 증가함에 따라 학습 시간은 어떻게 변화하는가?
주요 결과
- 최적화된 16개의 음향 특징을 사용하여 시스템은 98.28%의 인식률을 달성하였으며, 이는 본 연구에서 보고된 최고 성능이다.
- 유전 알고리즘이 관련 음향 특징을 효과적으로 선택하고 가중치를 조정함으로써 시스템 성능을 크게 향상시켰다.
- 최적 구성(16개 특징)의 학습 시간은 5시간 30분 17초였으며, 이는 실현 가능한 계산 비용임을 시사한다.
- 특징 벡터 크기가 16개까지 증가함에 따라 성능이 향상되었고, 이후에는 추가적인 향상이 관찰되지 않았다.
- 하이브리드 접근법은 기준 시스템을 능가하여, 말 생산에 관한 도메인 전문 지식과 진화 최적화를 융합한 것이 효과적임을 입증했다.
- 결과적으로, 이석성 말하기의 ASR 강건성을 향상시키기 위해 유전 알고리즘을 통한 특징 최적화가 실현 가능한 전략임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.