Skip to main content
QUICK REVIEW

[論文レビュー] Swar The Voice Operated PC

Kamlesh Sharma, T. Durga Prasad|arXiv (Cornell University)|Jan 1, 2009
Speech and Audio Processing参考文献 1被引用数 3
ひとこと要約

本論文では、音声認識に隠れマルコフモデル(HMM)を用いた、手を使わずに操作可能なPCシステムを提案している。このシステムは、音声入力を特徴抽出(MFCCとエネルギー)で処理し、学習済みのHMMモデルと照合してコマンドを実行する。物理的障害者や低学力層のユーザーにとって実用的なソリューションを提供する。

ABSTRACT

Keyboard, although a popular medium, is not very convenient as it requires a certain amount of skill for effective usage. A mouse on the other hand requires a good hand-eye co-ordination. Also current computer interfaces also assume a certain level of literacy from the user. It also expect the user to have certain level of proficiency in English. In our country where the literacy level is as low as 50% in some states, if information technology has to reach the grass root level; these constraints have to be eliminated. As a solution for these, Speech Recognition and hence the concept of Voice operated computer system comes into picture. In this paper we propose a technique to develop a voice recognition system which will be used for controlling computer via speech input from any user i.e. without the use of mouse and / or keyboard. Once developed this system would be of great benefit to physically handicapped people as Instead of scrolling through written procedures on a laptop or handheld computer, they can wear a headset and have their hands and eyes free.

研究の動機と目的

  • キーボードやマウスに依存しない音声制御PCシステムの開発を目的とする。
  • インドにおける識字率が50%にまで低い状況を踏まえ、身体的障害者や低学力層のユーザーが利用しやすいインターフェースの障壁を解消することを目的とする。
  • 英語の習得やキーボード操作のスキルが不要な、HMMを用いた音声認識システムを実装し、コマンドベースの対話型操作を可能にすることを目的とする。
  • リアルタイム環境下でも耐障害性を有する連続音声入力とコマンド認識を可能にするシステムの設計を目的とする。

提案手法

  • マイクを介して音声入力を取得し、エネルギーとゼロクロスレートを用いた語検出モジュールで処理する。
  • 特徴抽出では、各音声フレームに対してメル周波数 cepstrum コ-efficient(MFCC)と正規化されたエネルギーを計算する。
  • 連続的かつ多次元的な隠れマルコフモデル(HMM)を認識に用い、状態遷移は遷移確率と観測尤度に基づく。
  • 各認識された語は、複数の音声サンプルで学習された固有のHMMモデルに関連付けられ、初期モデルパラメータは学習データの最初のN個の特徴ベクトルで設定される。
  • 比較モジュールを用いて、リアルタイム入力とデータベース内の保存済み .wav または .au ファイルを照合し、コマンドの正当性を検証する。
  • 開発を簡素化し、コードサイズを削減し、オブジェクト指向プログラミングおよびハードウェアインタラクションを支援するため、.NET API を実装に用いる。

実験結果

リサーチクエスチョン

  • RQ1キーボードやマウスの入力が不要な音声認識システムを、どのように設計すれば効果的に機能させるか?
  • RQ2身体的障害者や低学力層のインドのユーザーに対するアクセシビリティを向上させるために、どのような技術が有効か?
  • RQ3HMMベースのモデルをどのように学習・適用することで、音声入力からの正確な単語認識を達成できるか?
  • RQ4特徴抽出(MFCCとエネルギー)が認識精度の向上に果たす役割は何か?
  • RQ5システムは、関係のない会話やノイズと有効な音声コマンドをどのように区別するか?

主な発見

  • 本システムは、キーボードやマウスに依存しないHMMベースの音声認識を用いた音声操作PCを成功裏に実装し、音声コマンドによる制御を可能にした。
  • MFCCと正規化されたエネルギーを用いた特徴抽出は、信頼性の高いモデル学習に適した音声の音素的特徴を効果的に捉えている。
  • HMMモデルは、観測値を状態に割り当てるためにユークリッド距離を用いて学習され、連続観測からの遷移確率が推定される。
  • リアルタイム入力と照合するため、あらかじめ記録された音声サンプルを .au または .wav 形式で保存したファイルベースのデータベースが使用されている。
  • .NET API の使用により、開発が簡素化され、コードの複雑さが低減し、リアルタイム処理に適した効率的なハードウェアインタラクションが可能になった。
  • 本システムは、実世界への導入可能性を示しているが、特に身体的障害者や低学力層のユーザーにとって有効である。一方で、耐障害性と連続音声処理の面で課題が残っている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。