[論文レビュー] Egyptian Sign Language Recognition Using CNN and LSTM
本論文は、聴覚障害者と聴覚のある人々の間のコミュニケーションギャップを解消するために、畳み込みニューラルネットワーク(CNN)と長短期記憶(LSTM)ネットワークを用いた動画ベースのエジプト手話(ESL)認識システムを提案する。CNNはフレームからの空間的特徴を抽出するが、CNN-LSTMアーキテクチャは空間的および時間的ダイナミクスを両方捉え、9つの一般的なESL語の認識で90%の正確性を達成した。
Sign language is a set of gestures that deaf people use to communicate. Unfortunately, normal people don't understand it, which creates a communication gap that needs to be filled. Because of the variations in (Egyptian Sign Language) ESL from one region to another, ESL provides a challenging research problem. In this work, we are providing applied research with its video-based Egyptian sign language recognition system that serves the local community of deaf people in Egypt, with a moderate and reasonable accuracy. We present a computer vision system with two different neural networks architectures. The first is a Convolutional Neural Network (CNN) for extracting spatial features. The CNN model was retrained on the inception mod. The second architecture is a CNN followed by a Long Short-Term Memory (LSTM) for extracting both spatial and temporal features. The two models achieved an accuracy of 90% and 72%, respectively. We examined the power of these two architectures to distinguish between 9 common words (with similar signs) among some deaf people community in Egypt.
研究の動機と目的
- 聴覚障害者が使用するエジプト手話(ESL)と聴覚のある人々の間のコミュニケーションギャップを埋める。
- ESLにおける地域的差異が、一貫した手話認識に課題をもたらすため、その問題に対処する。
- エジプトの聴覚障害者コミュニティに特化した実用的で現地に適したコンピュータビジョンシステムを開発する。
- 局所化されたESLデータセット上で、2つのディーパーラーニングアーキテクチャ—CNNとCNN-LSTM—の性能を評価する。
- 類似したジェスチャーを持つ一般的なESL語の認識で中程度から高い正確性を達成し、誤分類を低減する。
提案手法
- エジプト手話の独自動画データセットで微調整された、事前学習済みのInceptionベースのCNNモデルを活用した。
- CNN部を用いて個々の動画フレームからの空間的特徴を抽出し、手の形や位置を捉えた。
- CNNとLSTMネットワークを組み合わせ、フレーム間の順序的依存関係をモデル化し、手話動作の時間的ダイナミクスを捉えた。
- 9つの一般的なESL語を視覚的特徴が類似するものとして分類するため、動画シーケンス上でCNN-LSTMアーキテクチャをエンドツーエンドで訓練した。
- 限られた現地データに対する一般化を向上させるために、動画データオーグメンテーションとトランスファーラーニング技術を採用した。
- 保持されたテストセットの手話動画を用いて、モデルの性能を正確性指標で評価した。
実験結果
リサーチクエスチョン
- RQ1CNNベースのモデルは、空間的特徴のみを用いても、エジプト手話の認識で高い正確性を達成できるか?
- RQ2LSTMによる時間的モデリングを組み込むことで、動的な手話ジェスチャーの認識正確性はどの程度向上するか?
- RQ3エジプト手話における地域的差異は、ディーパーラーニングベースの認識システムの性能にどのように影響するか?
- RQ4局所化されたESLデータセット上で、スタンドアロンのCNNとCNN-LSTMハイブリッドアーキテクチャの性能にどのような差が生じるか?
- RQ5中程度のサイズの現地データセットで訓練されたディーパーラーニングシステムは、実世界のESLコミュニケーション応用で実用的な正確性を達成できるか?
主な発見
- スタンドアロンのCNNモデルは、9つの一般的なエジプト手話語のテストセットで90%の認識正確性を達成した。
- CNN-LSTMハイブリッドモデルは72%の低い正確性にとどまり、この特定の設定では時間的モデリングが性能向上に寄与しなかった。
- 結果から、選択された類似ジェスチャーを持つエジプト手話語の文脈では、空間的特徴のみで十分に識別可能であることが示唆された。
- CNNオンリーモデルの高い正確性は、局所化された手話認識において、Inceptionベースのアーキテクチャを用いたトランスファーラーニングの有効性を示している。
- 2つのモデル間の性能差は、時間的ダイナミクスが明確でない場合、LSTMを追加するとノイズや過学習を引き起こす可能性があることを示している。
- 高い正確性と現地データに特化したアプローチから、このシステムはエジプトの聴覚障害者コミュニティにおける実用的導入の可能性を示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。