[論文レビュー] Signing at Scale: Learning to Co-Articulate Signs for Large-Scale Photo-Realistic Sign Language Production
本論文は、フレーム選択ネットワーク(FS-Net)を用いて辞書的サイン間の共articulationを学習し、独自のキーポイントベース損失を備えたポーズ条件付きGAN(SignGAN)により高精細なサイン言語動画を生成する、スケーラブルで写真のようにリアルなサイン言語生成システムを提案する。この手法はPHOENIX14 Tでバックトランスレーションにおいて最先端の性能を達成し、聴覚障害者による評価でも、ベースライン手法と比較して、リアリズムと理解度の面で顕著に優れている。
Sign languages are visual languages, with vocabularies as rich as their spoken language counterparts. However, current deep-learning based Sign Language Production (SLP) models produce under-articulated skeleton pose sequences from constrained vocabularies and this limits applicability. To be understandable and accepted by the deaf, an automatic SLP system must be able to generate co-articulated photo-realistic signing sequences for large domains of discourse. In this work, we tackle large-scale SLP by learning to co-articulate between dictionary signs, a method capable of producing smooth signing while scaling to unconstrained domains of discourse. To learn sign co-articulation, we propose a novel Frame Selection Network (FS-Net) that improves the temporal alignment of interpolated dictionary signs to continuous signing sequences. Additionally, we propose SignGAN, a pose-conditioned human synthesis model that produces photo-realistic sign language videos direct from skeleton pose. We propose a novel keypoint-based loss function which improves the quality of synthesized hand images. We evaluate our SLP model on the large-scale meineDGS (mDGS) corpus, conducting extensive user evaluation showing our FS-Net approach improves co-articulation of interpolated dictionary signs. Additionally, we show that SignGAN significantly outperforms all baseline methods for quantitative metrics, human perceptual studies and native deaf signer comprehension.
研究の動機と目的
- 制限されたドメイン(例:天気予報)にとどまらず、自由な話題領域における、共articulatedで写真のようにリアルなサイン言語動画生成の欠如に対処すること。
- 辞書的サイン間の時間的プロソディをモデル化することで、合成されたサインの自然さと理解度を向上させること。
- 天気予報のような限定ドメインデータセットを超えて一般化できるスケーラブルなSLPシステムの開発。
- 特に動きぼけの影響を受ける状況下でも、生成されたサイン言語動画における手の画像合成品質の向上。
- ネイティブの聴覚障害者による包括的なユーザーテストを通じて、システムの有効性を検証すること。
提案手法
- 辞書的サインと連続的なサインシーケンスの間で最適な時間的アライメントパスを学習するフレーム選択ネットワーク(FS-Net)を提案。このネットワークは、動的時間ワープ(DTW)による教師信号を用い、トランスフォーマーのエンコーダとクロスアテンションを搭載。
- スケルトンポーズシーケンスから写真のようにリアルなサイン言語動画を生成するポーズ条件付きビデオ生成モデルであるSignGANを導入。
- キーポイント空間で動作する新しいキーポイントベース損失関数を設計し、合成における手の画像品質を向上させるとともに、動きぼけのアーティファクトを軽減。
- 実際のサインラーのデータから得た外見埋め込みを用いて、多様なサイン言語スタイルをモデル化するマルチモodalかつ制御可能なビデオ生成フレームワークを採用。
- 二段階パイプラインを採用:第一段階はテキストから語彙への変換、第二段階はFS-Netによる語彙から共articulatedポーズへの変換、最終段階ではSignGANによるポーズからビデオへの変換。
- 自由な話題領域への一般化を可能にするために、大規模なmDGSコーパスを訓練および評価に活用。
実験結果
リサーチクエスチョン
- RQ1深層学習モデルは、辞書的サイン間の共articulationを学習し、滑らかで連続的なサインシーケンスを生成できるか?
- RQ2ポーズ条件付きGANは、実データと区別がつかないほど写真のようにリアルなサイン言語動画を生成できるか?
- RQ3キーポイントベース損失関数は、サイン言語動画生成における手の合成品質を顕著に向上させるか?
- RQ4提案されたSLPシステムは、天気予報のような限定ドメインを超えて、大規模で自由な話題領域のドメインにも一般化可能か?
- RQ5生成された写真のようにリアルなコンテンツは、従来のスケルトンベース表現と比較して、ネイティブの聴覚障害者にとってより理解しやすいか?
主な発見
- FS-Netは、聴覚障害者によるユーザーテストを通じて、補間された辞書的サインの共articulationを顕著に向上させた。参加者の多くが、ベースライン手法と比較して、FS-Netの出力を好んで選んだ。
- SignGANは、PHOENIX14 Tベンチマークで、先行手法と比較してバックトランスレーション性能が43%向上し、高い意味的整合性を示した。
- 知覚評価では、SignGANは身体のリアリズムにおいて96.2%のケース、手のリアリズムにおいて95.6%のケースでベースラインモデルを上回り、Vid2vidが最も強いベースラインであったが、85.9%の選好度であった。
- 合成された写真のようにリアルな動画は、聴覚障害者からの理解度評価で3.9/5を達成し、スケルトンシーケンス(3.2/5)と比較して顕著に高い理解度を示した。
- キーポイントベース損失により、FIDは39.33(ベースライン)から27.75に低下し、手のSSIMは0.582から0.605に向上した。これにより、手の合成品質の向上が確認された。
- C4Aデータセットにおいて、定量的指標(FID、SSIM、手のSSIM)および人間の知覚評価の両面で、SignGANはすべての最先端手法を上回った。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。