[論文レビュー] SignDiff: Diffusion Model for American Sign Language Production
本稿では、テキストからエンドツーエンドでアメリカン・サイン言語(ASL)動画を生成するための拡散モデルであるSignDiffを紹介する。フレーム強化ネットワーク(FR-Net)を新たに導入することで、ポーズの正確性を向上させ、指のアーティファクトを低減した。How2Signでは17.19のBLEU-4、SSIMは84.9%を達成し、画像品質およびジェスチャーの忠実度において、先行手法を大きく上回る最先端の結果を達成した。
In this paper, we propose a dual-condition diffusion pre-training model named SignDiff that can generate human sign language speakers from a skeleton pose. SignDiff has a novel Frame Reinforcement Network called FR-Net, similar to dense human pose estimation work, which enhances the correspondence between text lexical symbols and sign language dense pose frames, reduces the occurrence of multiple fingers in the diffusion model. In addition, we propose a new method for American Sign Language Production (ASLP), which can generate ASL skeletal pose videos from text input, integrating two new improved modules and a new loss function to improve the accuracy and quality of sign language skeletal posture and enhance the ability of the model to train on large-scale data. We propose the first baseline for ASL production and report the scores of 17.19 and 12.85 on BLEU-4 on the How2Sign dev/test sets. We evaluated our model on the previous mainstream dataset PHOENIX14T, and the experiments achieved the SOTA results. In addition, our image quality far exceeds all previous results by 10 percentage points in terms of SSIM.
研究の動機と目的
- 連続的アメリカン・サイン言語生成(ASLP)のための、大規模かつ事前学習済みのディーブラーニングモデルの不足を解消すること。
- 従来、複雑さのためあまり利用されていなかったHow2Signデータセットを活用し、拡散モデルを用いたエンドツーエンドのテキストからサイン動画への生成を可能にすること。
- 複数の指のアーティファクトを低減し、骨格ポーズの正確性を向上させることで、サイン言語生成の品質を向上させること。
- 大規模かつ高品質なデータと拡散ベースのアーキテクチャを用いて、ASL生成のための包括的なベースラインを確立すること。
- 新しいモジュールとカスタム損失関数を導入することで、訓練の効率性とモデルの安定性を向上させること。
提案手法
- テキストとポーズ埋め込みの両方に条件付けられた二重条件付き拡散モデルであるSignDiffを提案。3次元人間のサイン言語動画を生成する。
- 密な人間のポーズ推定にインspiredされたフレーム強化ネットワーク(FR-Net)を新たに導入。語彙的記号と密なポーズフレームの対応を強化する。
- 視覚的、キーポイント、敵対的損失を組み合わせた新しい損失関数を採用。骨格ポーズの正確性を向上させ、指のアーティファクトを低減する。
- 予測された骨格シーケンスからリアルなサイン言語動画を生成するためのポーズ条件付き人間合成ヘッドを活用。
- 大規模な学習を支援するため、How2Signデータセットを広範な前処理とデータ拡張を経て変換。
- 手のポーズ強化モジュールとマルチスケール特徴の精錬を統合。局所的な手のディテールとグローバルな動きの整合性を向上。
実験結果
リサーチクエスチョン
- RQ1拡散ベースのモデルは、ポーズの正確性を向上させ、アーティファクトを低減させることで、テキスト入力から高精細で連続的なASL動画生成を達成できるか?
- RQ2提案されたフレーム強化ネットワーク(FR-Net)は、サイン言語生成におけるテキストと密なポーズフレームの対応をどのように向上させるか?
- RQ3新しい損失関数および補助モジュールは、サイン言語動画生成の品質と安定性にどのような影響を与えるか?
- RQ4SignDiffは、How2SignおよびPHOENIX14TにおけるBLEU、SSIM、FID、DTW指標において、既存の最先端モデルと比較してどのように差をつけるか?
- RQ5FR-Netは、性能を劣化させることなく、訓練の効率性と収束速度をどの程度向上させるか?
主な発見
- SignDiffはHow2Signの開発セットでBLEU-4スコア17.19、テストセットで12.85を達成。ASL生成のための最初の強力なベースラインを確立した。
- SSIMは84.9%、Hand SSIMは67.6%を達成。画像品質において、すべての先行手法を10ポイント以上上回った。
- FR-Netを導入したことで、手のポーズ誤差は23.09のベースラインから20.04に顕著に改善された。
- アブレーションスタディの結果、FR-Netは画像品質とDTW性能の両方を向上させ、真値シーケンスとの整合性が高まっていることが確認された。
- 定性的な結果から、SignDiffは、安定した拡散モデル(正確だがぼやける)やカートゥーン風モデル(詳細だが不正確)と比較して、ジェスチャーの正確性と指のディテールの両立をより良く実現している。
- PHOENIX14TでもSOTA性能を達成。How2Signで学習したにもかかわらず、データセット間での一般化能力が強く、顕著であった。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。