[論文レビュー] Visual Recognition of Isolated Swedish Sign Language Signs
本論文は、3次元手の動き、手の形、深度特徴を用いて、分離型スウェーデン手話(SSL)の符号を認識する、RGB-Dに基づく頑健なシステムを提示する。著者らは、識別者依存のばらつきを低減するためにフィッシャー線形判別分析(LDA)を適用し、94語の語彙において識別者依存認識で94%、識別者非依存認識で47%の精度を達成した。これはベースライン手法に比べ顕著な改善を示している。
We present a method for recognition of isolated Swedish Sign Language signs. The method will be used in a game intended to help children training signing at home, as a complement to training with a teacher. The target group is not primarily deaf children, but children with language disorders. Using sign language as a support in conversation has been shown to greatly stimulate the speech development of such children. The signer is captured with an RGB-D (Kinect) sensor, which has three advantages over a regular RGB camera. Firstly, it allows complex backgrounds to be removed easily. We segment the hands and face based on skin color and depth information. Secondly, it helps with the resolution of hand over face occlusion. Thirdly, signs take place in 3D; some aspects of the signs are defined by hand motion vertically to the image plane. This motion can be estimated if the depth is observable. The 3D motion of the hands relative to the torso are used as a cue together with the hand shape, and HMMs trained with this input are used for classification. To obtain higher robustness towards differences across signers, Fisher Linear Discriminant Analysis is used to find the combinations of features that are most descriptive for each sign, regardless of signer. Experiments show that the system can distinguish signs from a challenging 94 word vocabulary with a precision of up to 94% in the signer dependent case and up to 47% in the signer independent case.
研究の動機と目的
- 言語障害を有する児童が言語発達を支援するための、リアルタイムの手話認識システムの開発。
- 特に、不規則または変化する手話パターンを示す聴覚障害でない人々における、個人差による手話スタイルの高いばらつきの解消。
- 複雑な背景、照明、衣服の変化を伴う自然環境における認識の頑健性の向上。
- より良い3次元軌道モデリングのため、手の動き特徴に深度情報を統合して認識性能の向上。
- 識別者非依存認識を実現するため、LDAに基づく特徴変換により、個人の手話スタイルからクラスに相関する特徴を分離。
提案手法
- システムは、RGB-Dセンサ(Kinect)を用いて、被験者の色、深度、動きデータをリアルタイムで取得する。
- 肌色、深度のしきい値、動きの手がかりを用いて、手および顔のセグメンテーションを実施し、複雑な背景から手を分離する。
- 時間経過にわたる体幹に対する手の位置の追跡により、3次元手の軌道を抽出し、主な動き特徴とする。
- 手の形は、手の輪郭における勾配の方向のヒストグラム(HOG)を用いて表現し、深度マップから形状記述子(S)を計算する。
- フィッシャー線形判別分析(LDA)を用いて、高次元特徴ベクトルを、クラス間分離度を最大化し、識別者内ばらつきを最小化する低次元空間に射影する。
- 分類のため、各符号ごとに個別に訓練された隠れマルコフモデル(HMM)をLDA変換済み特徴に適用する。
実験結果
リサーチクエスチョン
- RQ13次元手の動きに基づく認識システムは、自然で制御されていない環境において、分離型スウェーデン手話符号を高い精度で認識できるか?
- RQ22次元RGBのみの特徴と比較して、深度情報を統合することで、認識性能がどの程度向上するか?
- RQ3フィッシャーLDAは、個人の手話スタイルのばらつきが認識精度に与える影響をどの程度低減できるか?
- RQ4本システムは、手話のスタイルに高いばらつきを示す言語障害のある児童に対しても、信頼性のある識別者非依存認識を実現できるか?
- RQ5実世界のゲームベースの学習環境において、識別者依存と識別者非依存認識の間の性能差はどの程度か?
主な発見
- 94語のSSL語彙において、識別者依存認識で94%の精度を達成し、個人の手話スタイルのばらつきに対して高い頑健性を示した。
- 識別者非依存設定では、LDA特徴変換後、47%の精度に到達した。これは、LDAを用いないベースライン手法に比べ10–15%の改善を示している。
- 被験者Aでは、LDA(25)を用いた場合、最高で39.97%の性能を示し、LDAが一貫した被験者に対して顕著な認識向上をもたらした。
- 被験者Bに対してはLDAが認識を向上させなかった。これは、不規則で確率的な手話行動を示す被験者に対して、LDAの有効性が制限されることを示している。
- 誤りマトリクスの分析から、LDAは識別者間で高いばらつきを示す符号に対して最も効果的に誤りを低減している一方、すべての被験者で一貫した動作を行う符号に対してはほとんど影響を及ぼさない。
- 動き特徴に深度情報を組み込むことで、認識性能が顕著に向上した。これは、3次元的な動きが画像平面に対して垂直な動きを含む符号の認識に、重要な手がかりを提供しているためである。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。