[논문 리뷰] Speaker Independent Continuous Speech to Text Converter for Mobile Application
이 논문은 모바일 애플리케이션을 위한 최적화된 발화자 독립형 연속 음성-텍스트 변환기 시스템을 제시한다. 소음 억제를 위해 에너지와 제로크로스 레이트를 기반으로 한 하이브리드 VAD를 사용하고, 특징 추출에는 MFCC를, 인식에는 일반화 회귀 신경망(GRNN)을 사용한다. 이 시스템은 최소한의 사용자별 음절 데이터베이스로 near-100% 정확도를 달성하여 자원 제약이 있는 기기, 예를 들어 스마트폰과 PDA에서 실시간으로 구동 가능하다.
An efficient speech to text converter for mobile application is presented in this work. The prime motive is to formulate a system which would give optimum performance in terms of complexity, accuracy, delay and memory requirements for mobile environment. The speech to text converter consists of two stages namely front-end analysis and pattern recognition. The front end analysis involves preprocessing and feature extraction. The traditional voice activity detection algorithms which track only energy cannot successfully identify potential speech from input because the unwanted part of the speech also has some energy and appears to be speech. In the proposed system, VAD that calculates energy of high frequency part separately as zero crossing rate to differentiate noise from speech is used. Mel Frequency Cepstral Coefficient (MFCC) is used as feature extraction method and Generalized Regression Neural Network is used as recognizer. MFCC provides low word error rate and better feature extraction. Neural Network improves the accuracy. Thus a small database containing all possible syllable pronunciation of the user is sufficient to give recognition accuracy closer to 100%. Thus the proposed technique entertains realization of real time speaker independent applications like mobile phones, PDAs etc.
연구 동기 및 목표
- 낮은 계산 및 메모리 오버헤드를 갖춘 모바일 플랫폼에 적합한 실시간이고 효율적인 음성-텍스트 변환기 개발
- 에너지와 제로크로스 레이트를 융합한 방법으로 음성 활동 검출(VAD)을 향상시켜 소음을 더 잘 구분하도록 함
- 최소한의 사용자별 훈련 데이터를 사용하여 발화자 독립 환경에서 높은 인식 정확도 달성
- 저지연 및 최적화된 복잡도로 스마트폰과 PDA와 같은 모바일 기기에서 실질적인 구현 가능하도록 설계
제안 방법
- 고주파 성분에서 에너지와 제로크로스 레이트를 동시에 분석하는 이중 지표 VAD를 도입하여 소음 구분 능력을 향상시킴
- 강건하고 컴act한 음성 특징 추출을 위해 멜 주파수 체르스탈 계수(MFCC)를 사용함
- 고정확도 분류를 위한 패턴 인식 엔진으로 일반화 회귀 신경망(GRNN)을 적용함
- 시스템을 두 단계로 설계: 전처리 및 특징 추출(프론트엔드), 그 다음 GRNN를 이용한 패턴 인식
- 사용자별 훈련 데이터베이스를 각 사용자의 가능한 모든 음절 발음으로 제한하여 저장 용량 최소화
- 모바일 환경에 적합하도록 전체 파이프라인을 저지연 및 저메모리 소비 최적화
실험 결과
연구 질문
- RQ1최소한의 자원 사용으로 모바일 기기에서 효율적으로 작동하는 발화자 독립형 연속 음성-텍스트 시스템을 개발할 수 있는가?
- RQ2소음 환경에서 거짓 긍정을 줄이기 위해 음성 활동 검출(VAD)을 어떻게 향상시킬 수 있는가?
- RQ3제한된 훈련 데이터로 MFCC와 GRNN가 함께 얼마나 높은 인식 정확도를 향상시킬 수 있는가?
- RQ4근접 100% 인식 정확도를 달성하기 위해 필요한 최소한의 사용자별 훈련 데이터베이스 크기는 얼마인가?
- RQ5모바일 하드웨어 제약 조건에서도 시스템이 실시간 성능을 유지할 수 있는가?
주요 결과
- 고주파 대역에서 제로크로스 레이트를 활용한 제안된 VAD 방법은 기존의 에너지만 사용하는 전통적 방법보다 음성과 배경 소음을 더 효과적으로 구분함
- MFCC 기반 특징 추출이 낮은 단어 오류율을 이끌어내어 인식의 강건성을 향상시킴
- GRNN 기반 인식기에서는 매우 작은 음절 수준의 사용자별 데이터베이스만으로도 인식 정확도가 거의 100%에 도달함
- 시스템은 낮은 계산 복잡도와 메모리 사용량을 보이며 실시간 모바일 배포에 적합함
- 향상된 VAD, MFCC, GRNN의 통합은 모바일 플랫폼에서 신뢰할 수 있는 발화자 독립형 연속 음성 인식을 가능하게 함
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.