[論文レビュー] Neural Sign Language Translation based on Human Keypoint Estimation
本稿では、ビデオからの2次元人体キーポイント推定を用いたニューラル共同言語翻訳システムを提案し、キーポイント特徴のための新規正規化手法を活用する。新たに提示された14,672本の高品質なビデオからなるKETI韓国手話データセットを用いて訓練されたモデルは、注意メカニズムを備えたシーケンス・トゥ・シーケンスアーキテクチャを採用し、105件の緊急関連文について検証で93.28%の精度、テストで55.28%の精度を達成した。
We propose a sign language translation system based on human keypoint estimation. It is well-known that many problems in the field of computer vision require a massive amount of dataset to train deep neural network models. The situation is even worse when it comes to the sign language translation problem as it is far more difficult to collect high-quality training data. In this paper, we introduce the KETI (short for Korea Electronics Technology Institute) sign language dataset which consists of 14,672 videos of high resolution and quality. Considering the fact that each country has a different and unique sign language, the KETI sign language dataset can be the starting line for further research on the Korean sign language translation. Using the KETI sign language dataset, we develop a neural network model for translating sign videos into natural language sentences by utilizing the human keypoints extracted from a face, hands, and body parts. The obtained human keypoint vector is normalized by the mean and standard deviation of the keypoints and used as input to our translation model based on the sequence-to-sequence architecture. As a result, we show that our approach is robust even when the size of the training data is not sufficient. Our translation model achieves 93.28% (55.28%, respectively) translation accuracy on the validation set (test set, respectively) for 105 sentences that can be used in emergency situations. We compare several types of our neural sign translation models based on different attention mechanisms in terms of classical metrics for measuring the translation performance.
研究の動機と目的
- 深層学習モデルの訓練に適した大規模かつ高品質な手話データセットの著しい不足に対処すること。
- 人体キーポイント特徴を用いて、手話動画を自然な日本語文に翻訳するニューラル手話翻訳システムを開発すること。
- キーポイント座標の正規化と時空間モデリングを活用することで、データが限られた状況下でのモデルの頑健性を向上させること。
- 手、顔、体の各身体部位が手話翻訳性能に与える寄与度を評価すること。
- 韓国語を対象とする国別データセットを用いて、今後の手話翻訳研究の基盤を構築すること。
提案手法
- システムは、顔、手、体を含む135個の人体キーポイントの2次元座標をOpenPoseを用いて手話動画から抽出する。
- キーポイントごとの平均と標準偏差を用いてキーポイント座標を正規化し、異なる発話者やカメラアングルに起因するばらつきを低減する。
- 正規化されたキーポイントシーケンスを、注意メカニズムを備えたシーケンス・トゥ・シーケンスニューラル翻訳モデルに供給する。
- モデルは、キーポイント埋め込みの時系列シーケンスを、韓国語の対応する自然言語文にマッピングするように訓練される。
- 翻訳性能の最適化を図るため、BahdanovやLuongなどの複数の注意メカニズムを比較する。
- アブレーションスタディを実施し、手、顔、体のキーポイントを個別および組み合わせて評価する。
実験結果
リサーチクエスチョン
- RQ1人体キーポイント推定は、手話翻訳の特徴表現としてどれほど有効であるか?
- RQ2手、顔、体の異なる身体部位が翻訳精度にどの程度寄与しているか?
- RQ3正規化されたキーポイント表現は、限られた学習データ下でモデルの一般化性能を向上させることができるか?
- RQ4本稿で提案するシステムは、ごみが散らかった背景や専門的でない発話者による実世界のばらつきに対して、どの程度の性能を示すか?
- RQ5注意メカニズムは、手話モデリングにおける翻訳品質にどのような影響を与えるか?
主な発見
- 提案されたシステムは、105件の緊急関連文について、検証セットで93.28%の翻訳精度、テストセットで55.28%の翻訳精度を達成した。
- モデルは実世界の条件に対しても良好に一般化し、非専門的発話者とごみが散らかった背景を含むテストセットで、ROUGE-Lが89.06、METEORが60.64、BLEUが77.08、CIDErが2.860を達成した。
- 両手のキーポイント情報が最も顕著に性能向上に寄与しており、手のみの特徴ではROUGE-Lが72.03を記録した。
- 顔キーポイントを追加すると一貫して性能が低下し、これは顔キーポイント数(70個)が体(12個)や手(24個)と比べて著しく多いことが原因であると考えられる。
- 体キーポイントを組み込むことで性能が向上(手と体の組み合わせでROUGE-Lが74.02)したが、相対的な空間的関係が失われるにもかかわらず、これは体キーポイントが有用な位置的文脈を提供していることを示唆している。
- アブレーションスタディの結果、この設定において手と体のキーポイントは顔キーポイントよりもより有益な情報を提供していることが確認された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。