Skip to main content
QUICK REVIEW

[论文解读] Sequence-to-Sequence Natural Language to Humanoid Robot Sign Language

Jennifer J. Gago, Valentina Vasco|arXiv (Cornell University)|Jul 9, 2019
Human Pose and Action Recognition参考文献 12被引用 6
一句话总结

本文提出了一种序列到序列的神经网络模型,将自然语言文本翻译为西班牙手语(LSE)标记,供人形机器人TEO执行。通过使用基于RealSense D435的定制3D骨骼获取流程以及基于LSTM的序列到序列架构,该系统实现了极低误差的准确手语翻译,展示了无需可穿戴设备的端到端人机手语交互的可行解决方案。

ABSTRACT

This paper presents a study on natural language to sign language translation with human-robot interaction application purposes. By means of the presented methodology, the humanoid robot TEO is expected to represent Spanish sign language automatically by converting text into movements, thanks to the performance of neural networks. Natural language to sign language translation presents several challenges to developers, such as the discordance between the length of input and output data and the use of non-manual markers. Therefore, neural networks and, consequently, sequence-to-sequence models, are selected as a data-driven system to avoid traditional expert system approaches or temporal dependencies limitations that lead to limited or too complex translation systems. To achieve these objectives, it is necessary to find a way to perform human skeleton acquisition in order to collect the signing input data. OpenPose and skeletonRetriever are proposed for this purpose and a 3D sensor specification study is developed to select the best acquisition hardware.

研究动机与目标

  • 开发一种端到端、无需可穿戴设备的手语翻译系统,用于人形机器人。
  • 解决手语翻译中语法结构差异与非手动标记的挑战。
  • 利用神经序列模型实现实时、准确的人形机器人手语生成。
  • 评估序列到序列模型在手语翻译中的可行性,避免基于规则或统计方法的局限性。
  • 建立基于OpenPose并经过优化的鲁棒3D骨骼获取流程,以实现实时手语动作追踪。

提出的方法

  • 使用带有256个LSTM单元和SoftMax输出层的序列到序列LSTM模型,采用分类交叉熵损失和RMSprop优化器(β=0.9)进行训练。
  • 输入和输出序列在词级别进行分词,标点符号使用特殊标记,并通过独热编码进行表示。
  • 实时3D骨骼重建流程使用OpenPose和skeletonRetriever从RGB-D数据中提取关节位置,通过Ipopt进行优化以增强遮挡鲁棒性。
  • 选择RealSense D435传感器,因其具备高分辨率、2 mm的深度精度和0.2–10 m的最优深度范围。
  • 使用查找表(LUT)将预测的LSE标记序列映射为TEO机器人动作指令,以实现物理签名执行。
  • 系统采用20%的交叉验证划分,训练100个周期,学习率分别为0.0001和0.001。

实验结果

研究问题

  • RQ1序列到序列神经网络能否在极少架构约束下有效将自然语言翻译为西班牙手语标记?
  • RQ2该系统如何处理口语语序与手语语序之间的结构差异?
  • RQ3非可穿戴、基于摄像头的3D骨骼追踪系统在实时状态下支持准确手语动作重建的程度如何?
  • RQ4该模型能否在包括疑问句、命令句和陈述句在内的多种句型中实现高标记级别准确度?
  • RQ5将优化后的骨骼追踪与神经翻译模型结合,如何提升机器人手语生成的整体鲁棒性?

主要发现

  • 序列到序列模型在预测LSE标记序列方面表现出高准确度,关键术语如'Bien'、'Dormir'、'Colegio'和'Edad Cuántos'均被正确预测。
  • 该模型成功翻译了复杂句型,包括疑问句和命令句,正确实现了LSE语序(主语-宾语-动词)的重排。
  • 由于其在分辨率、深度精度(2 mm)和工作范围(0.2–10 m)之间的良好平衡,RealSense D435传感器被选为最优选择。
  • 使用OpenPose和Ipopt优化的骨骼重建流程有效处理了自遮挡和噪声深度数据,实现了实时性能。
  • 采用学习率α=0.0001进行训练时,损失曲线在图7中显示了稳定的收敛过程。
  • 该系统证明了无需可穿戴设备的端到端手语翻译在人形机器人中的可行性,未来可通过引入注意力机制和RNN进一步扩展。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。