Skip to main content
QUICK REVIEW

[論文レビュー] BosphorusSign22k Sign Language Recognition Dataset

Oğulcan Özdemir, Ahmet Alp Kındıroğlu|arXiv (Cornell University)|Apr 2, 2020
Hand Gesture Recognition Systems参考文献 48被引用数 33
ひとこと要約

BosphorusSign22k 大規模な Turkish Sign Language データセットを紹介し、OpenPose と Kinect v2 のモダリティを追加、評価プロトコルを定義して、IDT と 3D ResNets (MC3) を用いたベースライン結果を提供します。

ABSTRACT

Sign Language Recognition is a challenging research domain. It has recently seen several advancements with the increased availability of data. In this paper, we introduce the BosphorusSign22k, a publicly available large scale sign language dataset aimed at computer vision, video recognition and deep learning research communities. The primary objective of this dataset is to serve as a new benchmark in Turkish Sign Language Recognition for its vast lexicon, the high number of repetitions by native signers, high recording quality, and the unique syntactic properties of the signs it encompasses. We also provide state-of-the-art human pose estimates to encourage other tasks such as Sign Language Production. We survey other publicly available datasets and expand on how BosphorusSign22k can contribute to future research that is being made possible through the widespread availability of similar Sign Language resources. We have conducted extensive experiments and present baseline results to underpin future research on our dataset.

研究の動機と目的

  • トルコ手話の署名者に依存しない孤立指認SLRベンチマークを提供する。
  • BosphorusSign データセットを、より豊富なモダリティ(OpenPose、Kinect v2)と実用的なラベリングスキームでクリーンアップし、拡張する。
  • 評価プロトコルを定義し、新しいデータセットでのベースライン性能を確立する。
  • 手作業特徴と深層学習手法の両方を用いたベースライン結果を提供することで、今後の研究を可能にする。

提案手法

  • 誤った録画を削除し、手動特徴が類似するサインを統合した、BosphorusSign データセットを統合・クリーンアップした。
  • すべての動画にRGB、深度、OpenPose のジョイント(体、顔、手)、および Kinect v2 のスケルトンデータを提供した。
  • 署名者に依存しない評価プロトコルを、訓練/テスト分割(一人の署名者をテストに、他を訓練に)で確立した。
  • Fisher Vectorエンコードを用いたImproved Dense Trajectories (IDT) および混合2D-3D畳込みを用いた3D ResNet MC3モデルでベースラインをベンチマークした。
  • Kinetics-400で事前学習済みネットワークを微調整するのと0から訓練するのを比較し、さまざまなブロック微調整戦略を評価した。
  • IDTが高い性能を発揮することを示すベースライン結果を報告し、将来の改善を導くための失敗モードを分析した。)

実験結果

リサーチクエスチョン

  • RQ1トルコ手話の孤立認識における BosphorusSign22k での最先端の手作業特徴量(IDT)の性能はどの程度か?
  • RQ2現代の深層学習アーキテクチャ(MC3 3D ResNet)は、署名者に依存しないトルコ手話グロス認識において、IDTと比べてどの程度の性能を示すか?
  • RQ3データモダリティ(RGB、深度、OpenPose ジョイント、Kinect スケルトン)が認識性能に与える影響は何か?
  • RQ4将来のベンチマークのために、明確な評価プロトコルを用いた署名者に依存しないベースラインを確立できるか?
  • RQ5視覚的に類似するトルコ手話グロスを区別する際の主要なエラー傾向と課題は何か?

主な発見

  • HOFとMBH特徴を用いたIDTは個別の運動成分でトップ1精度 86.63%、HOG、HOF、MBHを融合すると 88.53%を達成。
  • 3D ResNet MC3のベースラインは、最後の3ブロックを微調整した場合でTop-1精度 78.85%(Top-5で 94.76%)を達成。
  • このタスクでは、MC3をゼロから訓練する方が、事前学習済みのKinetics-400モデルを微調整するより優れている。
  • 外観特徴(HOG)と運動特徴の融合はベースライン全体で性能を向上させる一方、トラジェクトリ情報を追加すると精度がわずかに低下することがある。
  • データセットは Health、Finance、Common の 744 のサイングロスを提供し、6名の署名者から 22,542 本の動画(約19時間)。
  • 著者らは、微細な手の形状と長距離の時間的モデリングが署名者に依存しないSLRの主要なボトルネックであり続けると指摘している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。