[論文レビュー] Facial Expression Phoenix (FePh): An Annotated Sequenced Dataset for Facial and Emotion-Specified Expressions in Sign Language
本論文は、RWTH-PHOENIX-Weather 2014 データセットから抽出された、手話における顔の表情を注釈した最初の公開可能で順序付きの顔の表情データセットであるFePhを紹介する。本データセットは、7つの基本的感情と「なし」クラスを含む多様な頭部の姿勢、動き、感情ラベルを有する3,000枚以上の部分的にぼやけた動的顔画像を提供し、マルチモーダルな手話認識およびジェスチャー認識研究を可能にする。
Facial expressions are important parts of both gesture and sign language recognition systems. Despite the recent advances in both fields, annotated facial expression datasets in the context of sign language are still scarce resources. In this manuscript, we introduce an annotated sequenced facial expression dataset in the context of sign language, comprising over $3000$ facial images extracted from the daily news and weather forecast of the public tv-station PHOENIX. Unlike the majority of currently existing facial expression datasets, FePh provides sequenced semi-blurry facial images with different head poses, orientations, and movements. In addition, in the majority of images, identities are mouthing the words, which makes the data more challenging. To annotate this dataset we consider primary, secondary, and tertiary dyads of seven basic emotions of "sad", "surprise", "fear", "angry", "neutral", "disgust", and "happy". We also considered the "None" class if the image's facial expression could not be described by any of the aforementioned emotions. Although we provide FePh as a facial expression dataset of signers in sign language, it has a wider application in gesture recognition and Human Computer Interaction (HCI) systems.
研究の動機と目的
- マルチモーダルな手話認識研究を阻害する、手話文脈における注釈付き顔の表情データセットの不足に対処すること。
- 自然な手話使用をよりよく反映するため、動的顔の表情、頭部姿勢の変化、動きを含む視覚ベースの現実世界のデータセットを提供すること。
- 7つの基本的感情と「なし」クラスにわたる詳細な感情ラベルを提供することで、手話における顔の表情認識の研究を可能にすること。
- RWTH-PHOENIX-Weather 2014 データセットからの既存のハンドシェイプ注釈と組み合わせることで、マルチモーダルシステムの開発を支援すること。
- 手話認識を越えて、ジェスチャー認識およびヒューマンコンピュータインタラクション(HCI)分野における幅広い応用を促進すること。
提案手法
- 公共放送局PHOENIXの日刊ニュースおよび天気予報から、顔の表情が明確に見える発話者を対象に、3,000枚を超える顔の画像を抽出した。
- 7つの基本的感情(「悲しみ」「驚き」「恐怖」「怒り」「ニュートラル」「嫌悪」「幸せ」)と「分類不能」を表す「なし」クラスを用いて、各画像に一次・二次・三次感情のペアを注釈づけた。
- 動的顔の表情遷移の分析を可能にするために、元の動画フレーム順序を保持することで時間的順序を保存した。
- 連続的で手話認識の基準ベンチマークとして確立されたRWTH-PHOENIX-Weather 2014マルチ発話者データセットからのデータを選択し、一貫性を確保した。
- 共起する感情(例:「驚き_恐怖」)を捉えるために、多段階の注釈スキームを適用し、感情の微細な粒度を向上させた。
- 自然な放送動画からのフレーム選択により、頭部の姿勢、向き、動きの多様性を確保し、データセットの現実性と挑戦性を高めた。
実験結果
リサーチクエスチョン
- RQ1放送動画データから、手話文脈における大規模で現実世界の顔の表情データセットを効果的に構築できるか?
- RQ2手話における顔の表情が特定のハンドシェイプとどの程度相関しているか、そしてその相関関係を定量的に測定できるか?
- RQ3頭部の動きや異なる姿勢を伴う動的顔の表情が、手話における顔の表情認識モデルの性能に与える影響はどの程度か?
- RQ4顔の表情データとハンドシェイプデータを統合することで、マルチモーダルな手話認識システムの精度が向上するか?
- RQ5手話における異なるハンドシェイプクラスごとの顔の表情の分布と頻度はどのようになっており、意味的または文法的関連性を示唆しているか?
主な発見
- FePhデータセットは、実際の放送動画から抽出された3,000枚を超える顔の画像を含み、多様な頭部の姿勢、動き、部分的にぼやけた状態を特徴としている。
- ハンドシェイプクラスと特定の顔の表情との間に顕著な相関が確認され、ハンドシェイプクラス「3」は「恐怖」と0.697、『驚き』と0.383の相関を示した。
- ヒートマップ分析により、特定のハンドシェイプと「恐怖」などの顔の表情が不釣り合いに多く共起していることが確認され、文法的または感情的意義があることを示唆した。
- 同じハンドシェイプでも異なる顔の表情が付随していることがデータセットで明らかになった。これは、意味の明確化において顔の表情が果たす重要な役割を示している。
- 「なし」クラスの注釈が含まれていることで、すべての表情が基本的感情カテゴリに収まらない現実世界の顔の表情ラベリングの複雑さが浮き彫りになった。
- 顔の表情データと既存のRWTH-PHOENIX-Weather 2014 MSハンドシェイプデータセットを組み合わせることで、将来的なマルチモーダル学習が可能となり、手話認識に向けた包括的なリソースを提供した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。