[論文レビュー] Optimization of Transfer Learning for Sign Language Recognition Targeting Mobile Platform
本論文では、27,455枚の手のジェスチャー画像を用いて、リアルタイムのアメリカン・サイン・ランゲージ(ASL)アルファベット認識を実現するモバイル最適化転移学習システムを提案する。事前学習済みの深層学習モデルを微調整し、モバイルデプロイメントに最適化することで、メモリ効率の高いモバイルアプリケーション上で95.03%の精度を達成し、平均推論時間は2.42秒となった。
The target of this research is to experiment, iterate and recommend a system that is successful in recognition of American Sign Language (ASL). It is a challenging as well as an interesting problem that if solved will bring a leap in social and technological aspects alike. In this paper, we propose a real-time recognizer of ASL based on a mobile platform, so that it will have more accessibility and provides an ease of use. The technique implemented is Transfer Learning of new data of Hand gestures for alphabets in ASL to be modelled on various pre-trained high- end models and optimize the best model to run on a mobile platform considering the various limitations of the same during optimization. The data used consists of 27,455 images of 24 alphabets of ASL. The optimized model when ran over a memory-efficient mobile application, provides an accuracy of 95.03% of accurate recognition with an average recognition time of 2.42 seconds. This method ensures considerable discrimination in accuracy and recognition time than the previous research.
研究の動機と目的
- 聴覚に障害がある人や難聴の人々のアクセシビリティを向上させるために、リアルタイムで動作し、モバイルデバイスにデプロイ可能なアメリカン・サイン・ランゲージ(ASL)アルファベット認識システムの開発を目的とする。
- 制限されたメモリと処理能力を備えたリソース制約のあるモバイルプラットフォームに、正確な深層学習モデルをデプロイする課題に対処することを目的とする。
- カスタムASL手のジェスチャーデータセット上で事前学習済みモデルを微調整することにより、最大の精度と効率を実現するように転移学習を最適化することを目的とする。
- リアルタイムモバイルアプリケーションに適した、高い認識精度と低い推論遅延のバランスを実現することを目的とする。
提案手法
- 本研究では、学習済みImageNetモデルを初期化に用いることで、階層的特徴を活用する転移学習を採用する。
- 24種類のASLアルファベットを表す27,455枚の画像から構成されるカスタムデータセットを収集し、事前学習済みモデルの微調整に使用する。
- モデル最適化には、知識蒸留、プルーニング、量子化を適用し、モバイルデプロイメントに適したモデルサイズと推論時間を削減する。
- 最終的なモデルは、メモリ効率の高いモバイルアプリケーションにデプロイされ、リアルタイム推論が可能になる。
- 性能評価は、モバイルプラットフォーム上での精度と平均推論時間に基づいて実施する。
- 複数の事前学習済みモデル(例:MobileNet、DenseNet)を比較し、モバイルデプロイメントに最適なアーキテクチャを同定する。
実験結果
リサーチクエスチョン
- RQ1メモリ制限のあるモバイルデバイス上で高い精度を維持しつつ、ASL手のジェスチャー認識に最適な事前学習済み深層学習モデルは何か?
- RQ2転移学習をどのように最適化すれば、モバイルプラットフォーム上でモデルサイズと推論時間を削減しながら認識精度を損なわずに済ますことができるか?
- RQ3実際のモバイルアプリケーションに微調整済みモデルをデプロイした場合、達成可能な認識精度と推論速度の水準はどの程度か?
- RQ4本手法は、ASL認識における精度とリアルタイム性能の観点から、先行研究と比較してどのように優れているか?
- RQ5量子化やプルーニングなどのモデル圧縮技術(例)は、モデル効率と認識性能の間で、どの程度の妥協をもたらすか?
主な発見
- 最適化されたモデルは、モバイルプラットフォームにデプロイされた際、ASLアルファベットデータセットで95.03%の認識精度を達成した。
- 全クラスの平均推論時間は2.42秒であり、モバイルデプロイメントにおけるリアルタイム性を示している。
- 本システムは、モバイルハードウェア上での精度と推論効率の両面で、先行手法を上回った。
- MobileNetベースのモデルは最適化後、精度と速度の両立を効果的に果たす優れたパフォーマンスを示した。
- 量子化やプルーニングなどのモデル圧縮技術は、高い精度を維持したままモデルサイズを顕著に削減した。
- カスタムASLデータセット上で事前学習済みモデルを微調整することで、学習から再構築する場合に比べて顕著な性能向上が達成された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。