[論文レビュー] Word separation in continuous sign language using isolated signs and post-processing
本論文は、分離型のサインモデルと後処理を活用して語の境界を検出する、連続サイン言語認識のための二段階フレームワークを提案する。均一なフレーム数を持つ分離型サインで訓練されたモデルは、CNN-SVD-LSTMアーキテクチャに続き、閾値ベースの後処理ステップを実装し、連続的なシーケンス内の分離型サインを特定する。RKS-PERSIANSIGNデータセットでは平均98%のSoftmax信頼度を達成し、ASLLVDでは59%を記録した。
. Continuous Sign Language Recognition (CSLR) is a long challenging task in Computer Vision due to the difficulties in detecting the explicit boundaries between the words in a sign sentence. To deal with this challenge, we propose a two-stage model. In the first stage, the predictor model, which includes a combination of CNN, SVD, and LSTM, is trained with the isolated signs. In the second stage, we apply a post-processing algorithm to the Softmax outputs obtained from the first part of the model in order to separate the isolated signs in the continuous signs. While the proposed model is trained on the isolated sign classes with similar frame numbers, it is evaluated on the continuous sign videos with a different frame length per each isolated sign class. Due to the lack of a large dataset, including both the sign sequences and the corresponding isolated signs, two public datasets in Isolated Sign Language Recognition (ISLR), RKS-PERSIANSIGN and ASLLVD, are used for evaluation. Results of the continuous sign videos confirm the efficiency of the proposed model to deal with isolated sign boundaries detection.
研究の動機と目的
- 連続サイン言語動画における分離型サイン間の明確な境界を検出する課題に対処すること。
- 大規模な連続サインデータセットを必要とせずに、分離型サイン言語認識(ISLR)から連続サイン言語認識(CSLR)への転移学習を可能にすること。
- Softmax出力の閾値を用いて、軽量で後処理可能な解決策を考案し、サイン境界検出を改善すること。
- 分離型動画から人工的に連続サインシーケンスを構築することで、実世界のISLRデータセット(RKS-PERSIANSIGNおよびASLLVD)上でモデルを評価すること。
- 特定の信頼度閾値を超えない場合に「Blank」ラベルを割り当てることで、誤検出を低減すること。
提案手法
- 各クラスのフレーム数が一定である分離型サイン動画で、CNN-SVD-LSTMハイブリッドモデルを訓練した。
- 連続サインシーケンスの各時系列フレームに対して、クラス確率を出力するSoftmax層を適用した。
- 信頼度閾値0.51を設定し、有効なサイン検出を判断する後処理アルゴリズムを実装した。
- この閾値を用いて低信頼度の予測を抑制し、誤ったサインクラスではなく「Blank」としてラベル付けした。
- 異なるクラスのフレーム長が異なる未処理の分離型サイン動画を連結することで、連続サイン動画を構築した。
- RKS-PERSIANSIGNの100本の連続サイン動画およびASLLVDの7本の連続サイン動画を用いてモデルを評価し、平均Softmax出力を性能指標とした。
実験結果
リサーチクエスチョン
- RQ1分離型サインで訓練されたモデルは、連続サインシーケンスにおけるサイン境界検出に一般化可能か?
- RQ2信頼度閾値を用いた後処理は、連続サイン認識における誤ったサイン検出の低減にどの程度効果的か?
- RQ3大規模な連続サインデータセットが入手できない状況下で、ISLRからCSLRへの転移学習は性能向上に寄与するか?
- RQ41つのサインクラスあたりの学習サンプル数が異なるデータセットにおいて、モデルの性能はどのように変化するか?
- RQ5視覚的類似度の高いサイン(例:「Excuse」と「Congratulation」)は、連続サインシーケンスにおける認識の信頼性にどの程度影響を及ぼすか?
主な発見
- 提案手法はRKS-PERSIANSIGNデータセットで平均0.98のSoftmax出力信頼度を達成し、サイン検出の高信頼性を示した。
- ASLLVDデータセットでは平均Softmax信頼度が0.59にとどまり、クラスあたりの学習サンプル数が少ないことが要因で信頼度が低かった。
- 後処理ステップにより誤ったサイン検出が効果的に抑制された。すべての誤検出は0.51の閾値未満のSoftmax出力を示した。
- サインクラスごとのフレーム長のばらつきがあっても、連続シーケンス内での分離型サインの同定に成功した。
- 視覚的に類似したサイン(例:「Fight」と「Competition」)は依然として困難であり、より多様なトレーニングサンプルの必要性が示された。
- 明示的な連続サインアノテーションがなくても、分離型サインデータのみを用いて実世界のシナリオで実用可能であることが示された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。