[논문 리뷰] Improvement of Text Dependent Speaker Identification System Using Neuro-Genetic Hybrid Algorithm in Office Environmental Conditions
이 논문은 사무실과 유사한 소음 환경에서의 텍스트 기반 화자 식별 성능을 향상시키기 위해 신경-유전 알고리즘 하이브리드를 제안한다. 위너 필터링, 체프스트르 특징(MFCC, LPC 등) 및 신경-유전 최적화 프레임워크를 결합함으로써, 사무실 조건에서 82.33%의 식별 정확도를 달성하여 실제 음향 환경에서의 강건성을 입증한다.
In this paper, an improved strategy for automated text dependent speaker identification system has been proposed in noisy environment. The identification process incorporates the Neuro- Genetic hybrid algorithm with cepstral based features. To remove the background noise from the source utterance, wiener filter has been used. Different speech pre-processing techniques such as start-end point detection algorithm, pre-emphasis filtering, frame blocking and windowing have been used to process the speech utterances. RCC, MFCC, MFCC, MFCC, LPC and LPCC have been used to extract the features. After feature extraction of the speech, Neuro-Genetic hybrid algorithm has been used in the learning and identification purposes. Features are extracted by using different techniques to optimize the performance of the identification. According to the VALID speech database, the highest speaker identification rate of 100.000 percent for studio environment and 82.33 percent for office environmental conditions have been achieved in the close set text dependent speaker identification system.
연구 동기 및 목표
- 배경 소음으로 인해 기존 시스템의 성능이 떨어지는 소음이 많은 사무실 환경에서 화자 식별 성능을 향상시키기 위해.
- 실제 비이상적인 음향 조건에서 텍스트 기반 화자 식별에 있어 낮은 식별 정확도 문제를 해결하기 위해.
- 신경망과 유전 알고리즘을 융합한 하이브리드 학습 메커니즘을 개발하여 최적의 특징 분류를 달성하기 위해.
- 스튜디오 및 사무실 조건에서 VALID 음성 데이터베이스를 사용하여 시스템 성능을 평가하기 위해.
- MFCC, LPC 등 다수의 체프스트르 기반 기법을 활용한 특징 추출 및 선택 최적화를 통해 분류 성능 향상시키기 위해.
제안 방법
- 처리 이전에 배경 소음을 줄이기 위해 위너 필터링을 적용하였다.
- 음성 사전 처리 단계로 음성 활동 검출(시작-종료 지점 검출), 프리-emphasis 필터링, 프레임 블로킹 및 하밍 윈도우 적용을 수행하였다.
- 다양한 체프스트르 특징(MFCC, LPC, LPCC, RCC)을 추출하여 강건한 화자 표현을 확보하였다.
- 신경-유전 하이브리드 알고리즘을 활용—유전 알고리즘을 통해 신경망 가중치 및 구조의 전역 최적화를 수행한 후, 분류를 위한 신경망 학습을 수행하였다.
- 특징 선택 및 유전 알고리즘을 통한 파rameter 튜닝을 병행하여 수렴성과 정확도 향상을 위한 시스템 최적화를 수행하였다.
- 통제된(스튜디오) 및 소음 있는(사무실) 조건에서 VALID 음성 데이터베이스를 사용한 폐쇄 집합 구성에서 시스템을 평가하였다.
실험 결과
연구 질문
- RQ1기존 방법과 비교해 볼 때, 신경-유전 하이브리드 알고리즘이 소음이 많은 사무실 환경에서 화자 식별 정확도를 크게 향상시킬 수 있는가?
- RQ2위너 필터링은 텍스트 기반 화자 식별 시스템에서 배경 소음을 줄이는 데 얼마나 효과적인가?
- RQ3MFCC, LPC, LPCC, RCC 중 어떤 조합의 체프스트르 특징이 소음 조건에서 가장 높은 식별 정확도를 제공하는가?
- RQ4유전 알고리즘 최적화 통합이 신경망 기반 화자 분류기 성능을 얼마나 향상시키는가?
- RQ5실제 사무실과 유사한 음향 조건에서 제안된 시스템을 통해 달성 가능한 식별률은 얼마인가?
주요 결과
- 제안된 시스템은 VALID 데이터베이스를 사용해 통제된 스튜디오 환경에서 100%의 화자 식별 정확도를 달성하였다.
- 사무실 환경 조건에서 시스템은 82.33%의 식별 정확도를 기록하여 실제 소음 환경에서의 강건성을 입증하였다.
- 신경-유전 하이브리드 알고리즘이 유전적 탐색을 통해 신경망 가중치 및 아키텍처를 최적화함으로써 분류 성능을 크게 향상시켰다.
- 위너 필터링은 배경 소음을 효과적으로 감소시켜 신호 대 잡음비를 향상시키고 특징 추출 품질을 향상시켰다.
- 시험한 체프스트르 특징 중 MFCC, LPC, LPCC, RCC가 함께 소음 환경에서의 화자 분류 성능 향상에 기여하였다.
- 프리-emphasis, 윈도우 적용, 프레임 블로킹 등의 사전 처리 기법 조합이 특징 안정성과 시스템 신뢰도를 향상시켰다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.