Skip to main content
QUICK REVIEW

[논문 리뷰] Swar The Voice Operated PC

Kamlesh Sharma, T. Durga Prasad|arXiv (Cornell University)|2009. 01. 01.
Speech and Audio Processing참고 문헌 1인용 수 3
한 줄 요약

이 논문은 음성 인식을 위한 은닉 마르코프 모델(HMM)을 사용하는 음성 조작 PC 시스템을 제안하여 손으로 조작하지 않고도 말 명령어를 통해 제어할 수 있도록 한다. 시스템은 특징 추출(MFCC 및 에너지)을 통해 오디오 입력를 처리하고, 훈련된 HMM 모델과 비교하여 명령어를 실행하며, 신체적 장애가 있는 사용자 및 낮은 독해력 수준의 인구에게 실용적인 솔루션을 제공한다.

ABSTRACT

Keyboard, although a popular medium, is not very convenient as it requires a certain amount of skill for effective usage. A mouse on the other hand requires a good hand-eye co-ordination. Also current computer interfaces also assume a certain level of literacy from the user. It also expect the user to have certain level of proficiency in English. In our country where the literacy level is as low as 50% in some states, if information technology has to reach the grass root level; these constraints have to be eliminated. As a solution for these, Speech Recognition and hence the concept of Voice operated computer system comes into picture. In this paper we propose a technique to develop a voice recognition system which will be used for controlling computer via speech input from any user i.e. without the use of mouse and / or keyboard. Once developed this system would be of great benefit to physically handicapped people as Instead of scrolling through written procedures on a laptop or handheld computer, they can wear a headset and have their hands and eyes free.

연구 동기 및 목표

  • 키보드나 마우스에 의존하지 않는 음성 제어 PC 시스템을 개발하는 것.
  • 인도에서 50%에 이르는 낮은 독서 능력 수준을 고려해 신체적 장애자 및 낮은 독해력 수준의 사용자들이 사용하기 어려운 장벽을 해결하는 것.
  • 영어 능력이나 기술적인 키보드 사용 능력 없이도 명령어 기반 상호작용이 가능한 HMM 기반 음성 인식 시스템을 구현하는 것.
  • 실생활 환경에서 연속된 음성 입력과 강력한 명령어 인식을 지원하는 시스템을 설계하는 것.

제안 방법

  • 음성 입력은 마이크를 통해 캡처되고, 에너지와 제로 크로싱 레이트를 사용한 단어 탐지 모듈을 거친다.
  • 특징 추출은 각 음성 프레임에 대해 멜 주파수 페스트럼 계수(MFCC)와 정규화된 에너지를 계산한다.
  • 연속적이고 다차원적인 은닉 마르코프 모델(HMM)이 인식에 사용되며, 상태 전이 확률과 관측 가능성 확률에 의해 이导向된다.
  • 각 인식된 단어는 여러 음성 샘플에 기반해 훈련된 고유한 HMM 모델과 연결되며, 초기 모델 파라미터는 훈련 데이터의 첫 N개 특징 벡터를 사용해 설정된다.
  • 시스템은 실시간 입력과 데이터베이스에 저장된 .wav 또는 .au 파일을 비교하기 위해 비교 모듈을 사용하여 명령어를 검증한다.
  • 구현은 개발을 단순화하고 코드 크기를 줄이며 객체 지향 프로그래밍과 하드웨어 상호작용을 지원하기 위해 .NET API를 기반으로 한다.

실험 결과

연구 질문

  • RQ1키보드나 마우스 입력 없이도 효과적으로 작동하는 음성 인식 시스템을 어떻게 설계할 수 있는가?
  • RQ2신체적 장애가 있는 사용자 및 인도의 낮은 독해력 수준의 인구를 위한 접근성을 향상시키는 데 어떤 기법을 사용할 수 있는가?
  • RQ3HMM 기반 모델을 어떻게 훈련하고 적용하여 말 입력으로부터 정확한 단어 인식을 달성할 수 있는가?
  • RQ4특징 추출(MFCC 및 에너지)이 인식 정확도 향상에 어떤 역할을 하는가?
  • RQ5시스템은 유효한 음성 명령어를 무시할 수 있는 잡음이나 관련 없는 말과 어떻게 구분할 수 있는가?

주요 결과

  • 시스템은 HMM 기반 음성 인식을 사용하여 키보드나 마우스 없이도 말 명령어로 제어할 수 있는 음성 조작 PC를 성공적으로 구현하였다.
  • MFCC 및 정규화된 에너지를 사용한 특징 추출이 신뢰할 수 있는 모델 훈련을 위해 음소적 특징을 효과적으로 캡처하였다.
  • HMM 모델은 관측치를 상태에 할당하고 연속된 관측치에서 전이 확률을 추정하기 위해 유클리드 거리를 사용하여 훈련되었다.
  • 시스템은 실시간 입력과 비교하기 위해 .au 또는 .wav 형식의 사전 녹음된 음성 샘플 데이터베이스를 사용한다.
  • .NET API의 사용은 개발을 단순화하고 코드 복잡성을 줄이며 실시간 처리를 위한 효율적인 하드웨어 상호작용을 지원한다.
  • 시스템은 실생활 배포 가능성은 입증되었으며, 특히 장애가 있는 사용자 및 낮은 독해력 수준의 인구를 대상으로 유용하지만, 강인성과 연속된 음성 처리가 여전히 도전 과제로 남아 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.