Skip to main content
QUICK REVIEW

[論文レビュー] American Sign Language fingerspelling recognition in the wild

Bowen Shi, Aurora Martinez Del Rio|arXiv (Cornell University)|Oct 26, 2018
Hand Gesture Recognition Systems参考文献 34被引用数 5
ひとこと要約

本論文は、自然に発生するオンライン動画におけるアメリカン・サイン・ランゲージ(ASL)の指文字認識の初の研究を提示し、このタスクのための最大規模の公開データセットを導入した。独自の手検出器と系列モデル(特にCTCベースのアーキテクチャ)を用いて、42%の文字精度を達成し、低フレームレートと視覚的ばらつきの大きな課題があるにもかかわらず、実世界のサイン言語認識のためのベースラインを確立した。

ABSTRACT

We address the problem of American Sign Language fingerspelling recognition in the wild, using videos collected from websites. We introduce the largest data set available so far for the problem of fingerspelling recognition, and the first using naturally occurring video data. Using this data set, we present the first attempt to recognize fingerspelling sequences in this challenging setting. Unlike prior work, our video data is extremely challenging due to low frame rates and visual variability. To tackle the visual challenges, we train a special-purpose signing hand detector using a small subset of our data. Given the hand detector output, a sequence model decodes the hypothesized fingerspelled letter sequence. For the sequence model, we explore attention-based recurrent encoder-decoders and CTC-based approaches. As the first attempt at fingerspelling recognition in the wild, this work is intended to serve as a baseline for future work on sign language recognition in realistic conditions. We find that, as expected, letter error rates are much higher than in previous work on more controlled data, and we analyze the sources of error and effects of model variants.

研究の動機と目的

  • オンラインソースの制御されていない動画データから、アメリカン・サイン・ランゲージ(ASL)の指文字認識の課題に対処すること。
  • 現実世界の指文字動画を収集・公開し、高い視覚的ばらつきと低フレームレートを捉えた、最大規模の公開データセットを構築すること。
  • 制御されていない環境下でも頑健な性能を発揮するように、特化したサイン用手検出器と系列モデルを組み合わせた認識システムを開発・評価すること。
  • 現実的で「野生の状態」の条件下におけるサイン言語認識の今後の研究のためのベースラインを確立すること。

提案手法

  • 収集データの小さなサブセット上で訓練された、特別目的のサイン用手検出器を用いて、複雑で低品質な動画フレーム内のサイン用手を局所化する。
  • 検出された手領域は、解像度を向上させるためにスケーリング係数s=1で切り出し・アップサンプリングされた後、系列モデルに供給される。
  • 系列モデリングには、注意機構を備えたエンコーダ・デコーダモデルと、接続主義的時系列分類(CTC)ベースのモデルを用い、時間的変化する手形シーケンスから文字シーケンスをデコードする。
  • 光学フローを追加の入力モダリティとして検討したが、性能向上が顕著でなかったため、最終モデルでは使用しない。
  • 認識精度への影響を評価するために、自社で収集した指文字シーケンスとCMUdictを用いて訓練した言語モデルを評価した。
  • ビームサイズ、言語モデル重み、挿入ペナルティなどのハイパーパrameterを開発セット上で最適化し、デコード性能を最適化した。

実験結果

リサーチクエスチョン

  • RQ1スタジオベースのデータから自然に発生するオンライン動画に移行した場合、ASL指文字認識の性能はどの程度低下するか?
  • RQ2目的に特化した手検出器は、低品質で視覚的ばらつきの大きい条件下で、認識精度をどの程度向上させるか?
  • RQ3この困難な「野生の状態」の指文字認識タスクにおいて、CTCと注意機構を備えたエンコーダ・デコーダのどちらの系列モデリングアプローチが優れているか?
  • RQ4認識の主な誤り要因は何か? また、それらは異なる文字ペアや動画品質レベルでどのように変化するか?
  • RQ5限られた指文字データで訓練された言語モデルは、認識精度をどの程度向上させられるか?

主な発見

  • CTCベースのモデルは注意機構を備えたエンコーダ・デコーダモデルを上回り、ビームサーチ、挿入ペナルティ、言語モデルを併用した場合、開発セットで42.8%の文字精度を達成した。
  • 最も頻度の高い誤りタイプは削除であり、次に挿入が続く。エンコーダ・デコーダモデルはCTCモデルよりも多くの挿入と少ない削除を発生させた。
  • 一般的な誤った置換は、視覚的に類似した文字同士の混同によるもので、(u → r)、(o → e)、(y → i)、(w → u)、(j → i) が代表的である。特に(j → i)は、低フレームレートの動画における動的・静的ジェスチャーの混同に起因すると考えられる。
  • 低フレームレートは認識精度を顕著に低下させ、動画品質が劣化するにつれて性能が低下する傾向を示し、運動ブラーと時間的分解能の低下の影響を強調している。
  • 言語モデルはわずかだが測定可能な改善効果を示し、ビームサーチと挿入ペナルティを併用した場合、精度を約1%向上させた。
  • 光学フローとフレームのアップサンプリング(s > 1)は一貫したまたは顕著な性能向上をもたらさなかったため、最終モデルでは追求を中止した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。