Skip to main content
QUICK REVIEW

[論文レビュー] A Sign Language Recognition System with Pepper, Lightweight-Transformer, and LLM

JongYoon Lim, Inkyu Sa|arXiv (Cornell University)|Sep 28, 2023
Hand Gesture Recognition Systems被引用数 5
ひとこと要約

本論文では、Pepperロボットを用いたリアルタイムのアメリカン・サイン言語(ASL)認識システムを提示する。このシステムは、NVIDIA Jetsonモジュールに搭載された軽量なTransformerベースのモデルと、微調整された大規模言語モデル(LLM:ChatGPT)を組み合わせており、文脈に配慮したジェスチャーと対話生成を実現する。システムは組み込みハードウェア上で79.8%のASL認識精度を達成し、統合されたサイン認識とLLM駆動の共通言語ジェスチャーにより、自然なマルチモーダルな人間-ロボット対話が可能になる。

ABSTRACT

This research explores using lightweight deep neural network architectures to enable the humanoid robot Pepper to understand American Sign Language (ASL) and facilitate non-verbal human-robot interaction. First, we introduce a lightweight and efficient model for ASL understanding optimized for embedded systems, ensuring rapid sign recognition while conserving computational resources. Building upon this, we employ large language models (LLMs) for intelligent robot interactions. Through intricate prompt engineering, we tailor interactions to allow the Pepper Robot to generate natural Co-Speech Gesture responses, laying the foundation for more organic and intuitive humanoid-robot dialogues. Finally, we present an integrated software pipeline, embodying advancements in a socially aware AI interaction model. Leveraging the Pepper Robot's capabilities, we demonstrate the practicality and effectiveness of our approach in real-world scenarios. The results highlight a profound potential for enhancing human-robot interaction through non-verbal interactions, bridging communication gaps, and making technology more accessible and understandable.

研究の動機と目的

  • リソース効率の良いAIモデルを用いて、Pepperヒューマノイドロボットが組み込みハードウェア上でリアルタイムにアメリカン・サイン言語(ASL)を理解できるようにすること。
  • NVIDIA Jetsonモジュールのような低消費電力の組み込みシステムに、計算量の多いサイン言語認識を効率的にデプロイする課題に対処すること。
  • 大規模言語モデル(LLM)を用いて文脈的に適切な共通言語ジェスチャーと対話を生成することで、人間-ロボット対話の質を向上させること。
  • サイン認識とLLM駆動の応答を統合したエンドツーエンドのパイプラインを構築し、社会的配慮のあるマルチモーダルな人間-ロボット対話を実現すること。
  • ロボットがサイン言語と自然なジェスチャーでコミュニケーションできる仕組みを提供することで、聴覚に障害がある人々のアクセス性を向上させること。

提案手法

  • NVIDIA Jetsonモジュールにデプロイ可能な軽量な深層ニューラルネットワーク(DNN)モデルを、Transformerアーキテクチャに基づいて学習・量子化し、リアルタイムのASL認識を実現する。
  • Pepperのカメラが取得する動画入力から、MediaPipe Holisticを用いて2次元および3次元の身体ランドマーク(手、顔、ポーズ)を抽出する。
  • 抽出されたランドマークを軽量DNNモデルに供給し、リアルタイムでASLのサインを分類する。
  • ソケットベースのTCP/IPネットワーク通信プロトコルを用いて、Pepperロボット(Python 2)とJetsonモジュール(Python 3)間で双方向のデータ交換を実現する。
  • プロンプト工学を施したLLM(ChatGPT)が、認識されたサインに基づいて文脈に配慮した対話とそれに伴う共通言語ジェスチャーを生成し、自然な対話を可能にする。
  • サイン認識、LLM推論、ロボットジェスチャー実行が同期されるように、全パイプラインをリアルタイムシステムに統合する。
Figure 1: System Overview: frames capturing signs from Pepper are conveyed to the Jetson module, where landmarks are extracted and relayed to the ASL Recognition model. Subsequently, Co-Speech Gesture outputs are derived from ChatGPT and transmitted back to Pepper, enabling the execution of correspo
Figure 1: System Overview: frames capturing signs from Pepper are conveyed to the Jetson module, where landmarks are extracted and relayed to the ASL Recognition model. Subsequently, Co-Speech Gesture outputs are derived from ChatGPT and transmitted back to Pepper, enabling the execution of correspo

実験結果

リサーチクエスチョン

  • RQ1軽量なTransformerベースのモデルは、NVIDIA Jetsonのような組み込みハードウェア上で、効率的に動作しながらも高いASL認識精度を達成できるか?
  • RQ2大規模言語モデル(LLM)は、サイン言語対話に適した文脈的に関連するマルチモーダルな応答(音声とジェスチャー)をどれほど効果的に生成できるか?
  • RQ3サイン認識とLLM駆動の応答を統合したエンドツーエンドのリアルタイムシステムは、どれほど自然で社会的配慮のある人間-ロボット対話を可能にするか?
  • RQ4サイン言語認識において、ランドマーク検出ツール(例:MediaPipe)が深度情報と時間的ダイナミクスをどれほど正確に捉えられるか?
  • RQ5低遅延でリソース制限のあるロボットプラットフォームにおいて、マルチモーダルAIコンponentを効果的にオ케ストレーションできるか?

主な発見

  • 軽量DNNモデルは、NVIDIA Jetsonモジュール上で79.8%のASL認識精度を達成し、組み込みシステムへのリアルタイムデプロイの可能性を示した。
  • MediaPipe Holisticは、手、顔、身体の2次元ランドマーク検出において高い正確性を示したが、深度推定に限界があり、3次元空間的理解に影響を与えた。
  • LLM(ChatGPT)は、文脈に配慮した対話と多様な共通言語ジェスチャーを効果的に生成し、マルチモーダル対話の可能性を実証した。
  • 統合パイプラインは、ランドマーク抽出、サイン認識、LLM推論、ロボットジェスチャー実行の各段階で滑らかに連携し、システムの整合性とスケーラビリティを確認した。
  • 軽量モデルとLLMを組み合わせることで、現実世界の状況において社会的配慮のある非言語的対話が可能な人間-ロボットインタラクションの実用性を示した。
  • 有望な結果が得られたが、深度推定の課題と発話者間のばらつきへの耐性の欠如が残る課題として浮き彫りになったため、今後の改善の余地がある。
Figure 2: Extraction of Landmarks Using Mediapipe: The top row represents the sign for the word ’same’, the middle row depicts the sign for ’bad’, and the bottom row illustrates the sign for ’nuts’.
Figure 2: Extraction of Landmarks Using Mediapipe: The top row represents the sign for the word ’same’, the middle row depicts the sign for ’bad’, and the bottom row illustrates the sign for ’nuts’.

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。