Skip to main content
QUICK REVIEW

[論文レビュー] Can Everybody Sign Now? Exploring Sign Language Video Generation from 2D Poses

Lucas Ventura, Amanda Duarte|arXiv (Cornell University)|Dec 20, 2020
Hand Gesture Recognition Systems参考文献 9被引用数 15
ひとこと要約

本稿は、2次元ポーズキーポイントから生成されたリアルな手話動画が、母語としての聴覚障害者にとって理解可能かどうかを調査する。How2Signデータセットのサブセットを用い、Everybody Dance Now(EDN)GANベースのモーション転送モデルを適用した結果、生成動画はスケルトン可視化より好まれるが、手の生成は依然として劣悪であり、全体の理解度は向上するものの、理解度の制限要因となっていることが判明した。

ABSTRACT

Recent work have addressed the generation of human poses represented by 2D/3D coordinates of human joints for sign language. We use the state of the art in Deep Learning for motion transfer and evaluate them on How2Sign, an American Sign Language dataset, to generate videos of signers performing sign language given a 2D pose skeleton. We evaluate the generated videos quantitatively and qualitatively showing that the current models are not enough to generated adequate videos for Sign Language due to lack of detail in hands.

研究の動機と目的

  • 2次元ポーズキーポイントから生成された手話動画が、母語としての聴覚障害者によって理解可能かどうかを評価すること。
  • 2次元スケルトン可視化と比較して、リアルな動画出力の理解度を評価すること。
  • 最先端の画像生成モデル(EDN)が正確な手話動画を生成する際の限界を評価すること。
  • 特に手が重要な手話において、キーポイント検出の信頼性を定量化すること。
  • 現在のニューラル生成モデルが、即座に効果的な手話翻訳を可能にするかを調査すること。

提案手法

  • How2Signデータセットのソース動画から2次元キーポイントをOpenPoseを用いて抽出した。
  • 抽出された2次元ポーズシーケンスを元に、Everybody Dance Now(EDN)GANベースのモーション転送モデルを用いてリアルな符号動画を生成した。
  • 2名のプロのASL通訳者を含むHow2Sign動画のサブセットを用い、1人をソース、もう1人をターゲットアイデンティティとしてEDNモデルを訓練した。
  • 視覚的品質を2つの指標で評価した:検出されたキーポイントの割合(PDK)と正しいキーポイントの割合(PCK)、OpenPoseの信頼度を基準としたしきい値を設定した。
  • 4名の母語としてのASL話者を対象にユーザースタディを実施し、スケルトン可視化と生成動画の理解度を比較した。
  • トピック分類、主観的理解度(MOS)、英語翻訳の正確性(BLEUスコア)のフィードバックを収集した。

実験結果

リサーチクエスチョン

  • RQ1最先端のGANベース手法を用いて2次元ポーズキーポイントから生成された手話動画は、母語としての聴覚障害者が理解可能か?
  • RQ2リアルな生成動画の理解度は、2次元スケルトン可視化と比べてどの程度高いか?
  • RQ3現在の画像生成モデルが、手話の重要な要素たる手の動きをどれほど正確に再現できるか?
  • RQ4特に手の部分において、生成フレーム内のキーポイント検出はどの程度信頼できるか?
  • RQ5生成動画は英語への正確な翻訳をサポートできるか。これは、微細な理解度を示唆する。

主な発見

  • 生成動画はスケルトン可視化よりも好まれ、トピック分類の正確度は91.6%(スケルトンは83.3%)であった。
  • 生成動画の平均意見スコア(MOS)は2.58と、スケルトンの2.50よりわずかに高く、より良いと感じられる理解度を示した。
  • 英語翻訳のBLEUスコアは、生成動画(BLEU-1: 12.38)がスケルトン(10.90)よりも高かったが、すべてのスコアが低く、翻訳の正確性に制限があった。
  • 手のキーポイントにおけるPCKは、信頼度しきい値が高くなると著しく低下した—0.5の信頼度で正解率はたったの26%にとどまり、手の生成品質が著しく劣っていることが浮き彫りになった。
  • 全上半身キーポイントのPDKは99%と高かったが、手のキーポイントの検出信頼性は低く(0.5信頼度でPDK: 17%)、モデルが手領域の合成に失敗していることを示した。
  • 定性的な分析から、生成動画はしばしば手の動きや文構造を誤ってレンダリングし、誤ったまたは不完全な翻訳を生じさせていた。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。