[论文解读] A Sign Language Recognition System with Pepper, Lightweight-Transformer, and LLM
本论文提出了一套基于Pepper机器人、在NVIDIA Jetson模块上运行的轻量化Transformer模型以及微调后的大型语言模型(ChatGPT)的实时美国手语(ASL)识别系统,用于实现上下文感知的手势与对话生成。该系统在嵌入式硬件上实现了79.8%的ASL识别准确率,并通过集成的手语识别与LLM驱动的共言语手势,实现了自然、多模态的人机交互。
This research explores using lightweight deep neural network architectures to enable the humanoid robot Pepper to understand American Sign Language (ASL) and facilitate non-verbal human-robot interaction. First, we introduce a lightweight and efficient model for ASL understanding optimized for embedded systems, ensuring rapid sign recognition while conserving computational resources. Building upon this, we employ large language models (LLMs) for intelligent robot interactions. Through intricate prompt engineering, we tailor interactions to allow the Pepper Robot to generate natural Co-Speech Gesture responses, laying the foundation for more organic and intuitive humanoid-robot dialogues. Finally, we present an integrated software pipeline, embodying advancements in a socially aware AI interaction model. Leveraging the Pepper Robot's capabilities, we demonstrate the practicality and effectiveness of our approach in real-world scenarios. The results highlight a profound potential for enhancing human-robot interaction through non-verbal interactions, bridging communication gaps, and making technology more accessible and understandable.
研究动机与目标
- 为了使Pepper人形机器人能够使用资源高效的AI模型实现实时美国手语(ASL)理解。
- 为解决在NVIDIA Jetson模块等低功耗嵌入式系统上部署计算密集型手语识别系统的挑战。
- 通过大型语言模型(LLM)生成上下文相关的共言语手势与对话,提升人机交互质量。
- 开发一个集成的端到端流程,实现社会感知、多模态的人机交互,结合手语识别与LLM驱动的响应。
- 通过机器人以手语和自然手势进行交流,提升聋哑及听力障碍人士的可及性。
提出的方法
- 基于Transformer架构的轻量化深度神经网络(DNN)模型在NVIDIA Jetson模块上进行训练与量化,以实现实时ASL识别。
- 使用MediaPipe Holistic从Pepper机器人摄像头捕获的视频输入中提取2D与3D身体关键点(手部、面部、姿态)。
- 提取的关键点被输入至轻量化DNN模型,实现实时ASL手势分类。
- 通过基于套接字的TCP/IP网络通信协议,实现在Pepper机器人(Python 2)与Jetson模块(Python 3)之间的双向数据交换。
- 经过提示工程的大型语言模型(ChatGPT)根据识别出的手势生成上下文感知的对话及相应的共言语手势,实现自然交互。
- 整个流程被整合为一个实时系统,实现手势识别、LLM推理与机器人手势执行的同步。

实验结果
研究问题
- RQ1轻量化Transformer模型是否能在NVIDIA Jetson等嵌入式硬件上高效运行的同时,实现高ASL识别准确率?
- RQ2大型语言模型(LLM)在生成与手语交互相关的上下文相关、多模态响应(语音与手势)方面效果如何?
- RQ3集成手势识别与LLM驱动响应的实时端到端系统,在实现自然且具备社会感知的人机交互方面能达到何种程度?
- RQ4当前关键点检测工具(如MediaPipe)在捕捉深度信息与时间动态方面存在哪些局限性,影响手语识别?
- RQ5如何在低延迟、资源受限的机器人平台上有效编排多模态AI组件?
主要发现
- 轻量化DNN模型在NVIDIA Jetson模块上实现了79.8%的ASL识别准确率,证明了其在嵌入式系统上实现实时部署的可行性。
- MediaPipe Holistic在手部、面部与身体的2D关键点检测方面表现准确,但在深度预测方面存在局限,影响了3D空间理解能力。
- LLM(ChatGPT)成功生成了上下文感知的对话与多样化的共言语手势,展现出多模态交互的潜力。
- 集成流程在所有阶段(关键点提取、手势识别、LLM推理与机器人手势执行)均运行顺畅,证实了系统的整体一致性与可扩展性。
- 该系统展示了将轻量化模型与LLM结合用于实现社会感知、非语言人机交互在真实场景中的实用性。
- 尽管结果令人鼓舞,但在深度估计与对不同手语者差异的鲁棒性方面仍存在挑战,提示未来需进一步优化。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。