Skip to main content
QUICK REVIEW

[論文レビュー] Bangla sign language recognition using concatenated BdSL network

Thasin Abedin, Khondokar S. S. Prottoy|arXiv (Cornell University)|Jul 25, 2021
Hand Gesture Recognition Systems被引用数 8
ひとこと要約

本稿では、畳み込みニューラルネットワーク(CNN)からの視覚的特徴とポーズ推定ネットワークからのポーズキーポイントデータを統合することで、ベンガル手話(BdSL)認識のための新しい「連結BdSLネットワーク」を提案する。この手法はテストセットで91.51%の正確性を達成し、手のポーズ情報を組み込むことで、視覚的に類似したBdSL記号の認識が著しく向上することを示している。

ABSTRACT

Sign language is the only medium of communication for the hearing impaired and the deaf and dumb community. Communication with the general mass is thus always a challenge for this minority group. Especially in Bangla sign language (BdSL), there are 38 alphabets with some having nearly identical symbols. As a result, in BdSL recognition, the posture of hand is an important factor in addition to visual features extracted from traditional Convolutional Neural Network (CNN). In this paper, a novel architecture "Concatenated BdSL Network" is proposed which consists of a CNN based image network and a pose estimation network. While the image network gets the visual features, the relative positions of hand keypoints are taken by the pose estimation network to obtain the additional features to deal with the complexity of the BdSL symbols. A score of 91.51% was achieved by this novel approach in test set and the effectiveness of the additional pose estimation network is suggested by the experimental results.

研究の動機と目的

  • 視覚的特徴のみでは区別が難しい、視覚的に類似したベンガル手話(BdSL)アルファベットの認識に取り組む。
  • 従来のCNNベースのアプローチがBdSLにおける重要な手のポーズ差を捉えられていないという限界を克服する。
  • 深層学習とポーズ推定を統合することで、複雑なBdSL記号の認識正確性を向上させる。
  • 視覚的および空間的ハンド特徴表現を統合したハイブリッドアーキテクチャを構築し、より高い耐障害性を実現する。
  • 類似したBdSLサインの誤分類を低減するための追加のポーズベース特徴の有効性を実証する。

提案手法

  • 二本の分岐を持つニューラルネットワークアーキテクチャを設計:一方の分岐は、畳み込みニューラルネットワーク(CNN)を介して生画像入力を処理し、視覚的特徴を抽出する。
  • もう一方の分岐は、入力画像から手のキーポイントの相対的位置を検出・抽出するポーズ推定モデルを用いる。
  • CNNとポーズ推定ネットワークからの特徴マップを連結し、分類のための統一された表現を構築する。
  • 38種類の異なるアルファベットを含むラベル付きBdSLデータセットを用いて、連結ネットワークをエンドツーエンドで訓練する。
  • 最終予測のため、バックプロパゲーションとソフトマックス分類を含む標準的な深層学習最適化手法を活用する。
  • キーポイント座標を構造的事前知識として活用し、ポーズの違いにのみ依存する類似したBdSLジェスチャーの区別を向上させる。

実験結果

リサーチクエスチョン

  • RQ1ポーズキーポイントデータの統合は、視覚的に類似したベンガル手話アルファベットの認識正確性を向上させることができるか?
  • RQ2連結されたCNNとポーズ推定ネットワークは、BdSL認識において視覚的および構造的ハンド特徴をどれほど効果的に捉えられるか?
  • RQ3ハンドキーポイント位置からの追加の空間的特徴は、CNNオンリーモデルと比較して、BdSLにおける誤分類をどの程度低減するか?
  • RQ4提案されたアーキテクチャは、BdSLベンチマークデータセットにおいて、従来のCNNベースのアプローチを上回る性能を示すか?
  • RQ5ポーズ推定は、複雑なBdSL記号を認識する際の全体的な性能向上にどの程度寄与しているか?

主な発見

  • 提案された連結BdSLネットワークは、テスト正確性91.51%を達成し、BdSL認識タスクにおいて優れた性能を示した。
  • ポーズ推定特徴の組み込みにより、視覚的に類似したBdSL記号の認識が顕著に向上した。
  • モデルは、類似したサインを区別するために重要な、手のポーズの微細な差を効果的に捉えた。
  • 視覚的特徴とキーポイントベース特徴の統合により、CNNオンリーベースラインと比較して明確な性能向上が得られた。
  • 結果は、構造的ハンド情報が視覚的特徴を補完し、現実世界の手話認識における耐障害性を高めることを検証した。
  • このアーキテクチャは、ベンガル語圏の聴覚障害者や難聴者を対象とした支援的通信システムへの導入に有望である。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。