[論文レビュー] Novel Approach to Use HU Moments with Image Processing Techniques for Real Time Sign Language Communication
本論文では、画像処理とヒューモーメントを用いたポーズ分類により、低コストでリアルタイムに動作する手話認識システムを提示する。新たな高さ対幅比フィルタリングとヒューモーメント不変量を統合することで、制御されていない照明および背景条件下でも84%の正確性を達成し、聴覚障害者と聴覚健常者との間で実用的なコミュニケーションを可能にする。
Sign language is the fundamental communication method among people who suffer from speech and hearing defects. The rest of the world doesn't have a clear idea of sign language. "Sign Language Communicator" (SLC) is designed to solve the language barrier between the sign language users and the rest of the world. The main objective of this research is to provide a low cost affordable method of sign language interpretation. This system will also be very useful to the sign language learners as they can practice the sign language. During the research available human computer interaction techniques in posture recognition was tested and evaluated. A series of image processing techniques with Hu-moment classification was identified as the best approach. To improve the accuracy of the system, a new approach height to width ratio filtration was implemented along with Hu-moments. System is able to recognize selected Sign Language signs with the accuracy of 84% without a controlled background with small light adjustments
研究の動機と目的
- 聴覚障害者向けの低コストでリアルタイムに動作する手話コミュニケーションシステムの開発。
- 手話使用者と聴覚健常者との間のコミュニケーションギャップを埋める。
- 最小限の事前処理で、制約のない環境下でもジェスチャー認識の正確性を向上させること。
- インタラクティブな練習とフィードバックメカニズムを通じて、手話学習者を支援すること。
- ポーズ認識における人間-コンピュータインタラクション技術の評価と最適化。
提案手法
- システムはカメラ入力を用いて、手のジェスチャーをリアルタイムで動画で捉える。
- しきい値処理、ノイズ除去、エッジ検出などの画像前処理技術を適用し、手の形状を分離する。
- セグメンテーション処理を施した手領域から、7つの不変モーメントであるヒューモーメントを抽出し、形状特徴を記述する。
- 非ジェスチャー形状を除外し、分類のロバスト性を向上させるために、新規の高さ対幅比フィルタリングを導入する。
- システムは、ヒューモーメント特徴と高さ対幅比の組み合わせに基づいてジェスチャーを分類する。
- リアルタイム認識を実現するため、事前に定義された手話ジェスチャーのデータセットを用いて機械学習分類器を学習させる。
実験結果
リサーチクエスチョン
- RQ1変動する照明および背景条件下でも、ヒューモーメントはリアルタイムの手話認識において、手のジェスチャー形状を効果的に表現できるか?
- RQ2高さ対幅比フィルタリングをヒューモーメントと統合することで、単独のヒューモーメントと比較して認識正確性がどのように向上するか?
- RQ3制御されていない背景環境下で、システムの認識正確性はどの程度達成可能か?
- RQ4システムは、コミュニケーションと学習の両目的におけるリアルタイム相互作用をサポートできるか?
- RQ5コスト、複雑さ、パフォーマンスの観点から、既存のポーズ認識技術と比較して、本手法はどのように差別化されるか?
主な発見
- 本システムは、制御されていない背景を必要とせず、特定の手話ジェスチャーに対して84%の認識正確性を達成している。
- 高さ対幅比フィルタリングの追加により、非ジェスチャー形状からの誤検出が顕著に減少し、分類性能が向上した。
- システムはリアルタイムで動作し、コミュニケーションや学習アプリケーションにおけるインタラクティブ利用が可能である。
- わずかな照明調整でのみ効果を示し、環境変動に対して高いロバスト性を示している。
- ヒューモーメントの使用により、平行移動、回転、スケーリングに対して不変性が保たれ、形状認識の安定性が向上した。
- 本手法は低コストであり、標準的なコンピュータハードウェアでも実装可能で、アクセシビリティとスケーラビリティを支援する。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。