[論文レビュー] Application of Transfer Learning to Sign Language Recognition using an Inflated 3D Deep Convolutional Neural Network
本論文は、アメリカン・サイン・ランゲージ(ASL)の大型データセットであるMS-ASLで事前学習を行い、より小さなドイツ語サインランゲージ(SIGNUM)データセットで微調整する、インフレートド3次元畳み込みニューラルネットワーク(I3D)を用いた転移学習を、分離型サインランゲージ認識(SLR)に適用している。このアプローチは、非転移学習ベースラインと比較して最大21%の精度向上を達成し、データが少ないSLRの状況において顕著な有効性を示している。
Sign language is the primary language for people with a hearing loss. Sign language recognition (SLR) is the automatic recognition of sign language, which represents a challenging problem for computers, though some progress has been made recently using deep learning. Huge amounts of data are generally required to train deep learning models. However, corresponding datasets are missing for the majority of sign languages. Transfer learning is a technique to utilize a related task with an abundance of data available to help solve a target task lacking sufficient data. Transfer learning has been applied highly successfully in computer vision and natural language processing. However, much less research has been conducted in the field of SLR. This paper investigates how effectively transfer learning can be applied to isolated SLR using an inflated 3D convolutional neural network as the deep learning architecture. Transfer learning is implemented by pre-training a network on the American Sign Language dataset MS-ASL and subsequently fine-tuning it separately on three different sizes of the German Sign Language dataset SIGNUM. The results of the experiments give clear empirical evidence that transfer learning can be effectively applied to isolated SLR. The accuracy performances of the networks applying transfer learning increased substantially by up to 21% as compared to the baseline models that were not pre-trained on the MS-ASL dataset.
研究の動機と目的
- ラベル付きデータが限られる状況における、分離型サインランゲージ認識(SLR)における転移学習の有効性を調査すること。
- MS-ASLという大規模なサインランゲージデータセットで事前学習することで、ドイツ語サインランゲージの小規模なターゲットデータセット(SIGNUM)での性能が向上するかどうかを評価すること。
- 3次元畳み込みニューラルネットワーク(I3D)を用いた動画ベースのSLRに対して、転移学習がモデルの精度に与える影響を評価すること。
- 転移学習が、サインランゲージ認識タスクにおけるデータ不足の問題を軽減できるかどうかを特定すること。
提案手法
- アメリカン・サイン・ランゲージの広範な動画シーケンスを含むMS-ASLデータセットで、インフレートド3次元畳み込みニューラルネットワーク(I3D)を事前学習する。
- SIGNUMデータセットの3つの異なるサブセットサイズ(ドイツ語サインランゲージデータの量が異なる)に対して、事前学習済みI3Dモデルを微調整する。
- 転移学習と非転移学習ベースラインとの公平な比較を確保するため、標準的なデータ増強およびトレーニングプロトコルを適用する。
- SIGNUMで微調整する前に、ImageNetおよびMS-ASLで事前学習した重みを用いてI3Dネットワークを初期化することで、転移学習を実装する。
- I3DアーキテクチャをターゲットのSLRタスクにエンドツーエンドでトレーニングするために、交差エントロピー損失と確率的勾配降下法を用いる。
- さまざまなデータ環境下で、SIGNUMデータセットのテストスプリットにおけるトップ1精度を用いて、性能を評価する。
実験結果
リサーチクエスチョン
- RQ1訓練データが限られる状況において、転移学習が分離型サインランゲージ認識モデルの性能を顕著に向上させることができるか?
- RQ2大規模なサインランゲージデータセット(MS-ASL)で事前学習することで、小規模なターゲットデータセット(SIGNUM)で微調整されたモデルの精度にどのような影響を与えるか?
- RQ3SLRにおいて、豊富なデータで学習したモデルと限られたデータで学習したモデルとの間の性能格差を、転移学習がどの程度縮小できるか?
- RQ4インフレートド3次元CNNアーキテクチャを用いることで、動画ベースのサインランゲージ認識における転移学習の有効性が向上するか?
主な発見
- MS-ASLで事前学習した転移学習により、SIGNUMデータセットにおいて非事前学習ベースラインと比較して最大21%の精度向上が達成された。
- 性能向上は、SIGNUMデータセットの小さなサブセットで特に顕著であり、転移学習がデータ不足を効果的に緩和していることを示している。
- 限られたターゲットデータでさえも、微調整済みI3Dモデルは高い精度を達成しており、データが少ないSLRの状況において転移学習の頑健性が裏付けられている。
- 3次元CNNを用いた動画ベースのサインランゲージ認識に、転移学習が非常に効果的であることが結果から明らかになった。
- 事前学習モデルは、さまざまなデータサイズにおいても一貫した性能向上を示し、一般化性能が優れていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。