[論文レビュー] Fingerspelling recognition in the wild with iterative visual attention
本稿では、手の検出やセグメンテーションに依存せずに、制約のないリアルワールドの動画においてアメリカン・サイン・ランゲージ(ASL)のフィンガースプライティングをエンド・ツー・エンドで認識する反復的視覚的注目モデルを提案する。反復的なズームによって高解像度の注目領域に次第に集中することで、最先端の精度を達成し、従来の手法を大きく上回り、新たに収集された大規模なクラウドソーシングデータセットを組み合わせることでドメインシフトに対しても頑健であることを示した。
Sign language recognition is a challenging gesture sequence recognition problem, characterized by quick and highly coarticulated motion. In this paper we focus on recognition of fingerspelling sequences in American Sign Language (ASL) videos collected in the wild, mainly from YouTube and Deaf social media. Most previous work on sign language recognition has focused on controlled settings where the data is recorded in a studio environment and the number of signers is limited. Our work aims to address the challenges of real-life data, reducing the need for detection or segmentation modules commonly used in this domain. We propose an end-to-end model based on an iterative attention mechanism, without explicit hand detection or segmentation. Our approach dynamically focuses on increasingly high-resolution regions of interest. It outperforms prior work by a large margin. We also introduce a newly collected data set of crowdsourced annotations of fingerspelling in the wild, and show that performance can be further improved with this additional data set.
研究の動機と目的
- 高運動ブラーと複雑な背景を伴うリアルワールドの制約のない動画におけるフィンガースプライティング認識の課題に対処すること。
- 制御不能な環境では誤りが生じやすい手の検出やセグメンテーションモジュールに依存しないこと。
- 反復的注目を用いて動的に高解像度の注目領域に集中するエンド・ツー・エンドのモデルを開発すること。
- YouTube や聴覚障害者コミュニティのソーシャルメディアから収集したフィンガースプライティングのラベルを含む、新規の大規模な公開データセットを提供すること。
- 反復的注目が、外部の手検出器を組み合わせた場合でも、従来の手法に比べて顕著に認識精度を向上させることを示すこと。
提案手法
- モデルは、反復的に高解像度の注目領域にズームする反復的注目メカニズムを用い、複数ステップにわたり符号者の手に焦点を絞り込む。
- 各ステップで、モデルは入力フレームのクロップ領域に注目し、解像度を向上させるとともに背景の雑音を低減する。
- 注目メカニズムは、手の位置に関する明示的ラベルなしに、生の動画フレーム上でエンド・ツー・エンドで学習される。
- 安定性と性能向上のため、モデルは顔検出器を用いて注目領域を初期化する。
- 系列的な依存関係をモデル化するため、言語モデルヘッドを用いてモデルを学習する。
- 本手法は、ベンチマークスタジオデータセットと、新たに収集された大規模なクラウドソーシングによる野生動画データセットの両方で評価される。
実験結果
リサーチクエスチョン
- RQ1制約のない動画において、手の検出やセグメンテーションに依存せずに、エンド・ツー・エンドの注目ベースのモデルが優れたフィンガースプライティング認識精度を達成できるか?
- RQ2標準的な注目メカニズムや固定クロップ手法と比較して、反復的視覚的注目は、精度と計算効率の面でどのように優れているか?
- RQ3大規模なクラウドソーシングによるフィンガースプライティングデータセットが、さまざまなモデルの認識性能にどの程度向上効果をもたらすか?
- RQ4顔検出器の誤りに対して、反復的注目モデルはどの程度頑健か?(リアルワールドパイプラインの一般的な要因)
- RQ5注目メカニズムは、別個に学習された手検出器と比較して、正確な手の局所化を暗黙的に学習しているか?
主な発見
- 提案された反復的注目モデルは、ChicagoFSWild テストセットで 61.2% の文字認識精度を達成し、従来の最先端手法を大きく上回った。
- 手検出器が利用可能であっても、反復的注目モデルは顕著な性能向上を示し、検出器の上乗せとしての追加的価値があることを示した。
- 反復的注目を用いて学習したモデルは、同じミス率における平均IoU(0.413)を達成し、別個に学習した手検出器(0.223)よりも高い手の局所化精度を示した。
- 55,856 個のトレーニングシーケンスを含む、クラウドソーシングによる ChicagoFSWild+ データセットは、すべてのテストモデルにおいて顕著な性能向上をもたらした。
- モデルの推論時間は効率的で、1フレームあたり平均 65ms であり、リアルタイム応用に適している。
- 人間のパフォーマンスは、同じテストセットで 74.3% から 86.1% の範囲にあり、タスクが依然として困難であり、現在の機械性能を超える余地が残っていることを示している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。