Skip to main content
QUICK REVIEW

[论文解读] An Open-Source Gloss-Based Baseline for Spoken to Signed Language Translation

Amit Moryossef, Mathias Müller|arXiv (Cornell University)|May 28, 2023
Hand Gesture Recognition Systems被引用 4
一句话总结

本文提出了一种开源、可复现的语音转手语翻译流水线,通过文本-词素-姿态-视频框架,将德语、法语和意大利语文本转换为瑞士德语、法语和意大利手语。该系统整合了词干化器、基于规则的词序重排/删除模块以及使用 MeineDGS 语料库的神经机器翻译(NMT)系统,用于文本到词素的翻译;利用词典提取的骨骼姿态实现词素到姿态的转换;并通过共享代码和数据支持社区驱动的改进,为未来研究建立了基础基线。

ABSTRACT

Sign language translation systems are complex and require many components. As a result, it is very hard to compare methods across publications. We present an open-source implementation of a text-to-gloss-to-pose-to-video pipeline approach, demonstrating conversion from German to Swiss German Sign Language, French to French Sign Language of Switzerland, and Italian to Italian Sign Language of Switzerland. We propose three different components for the text-to-gloss translation: a lemmatizer, a rule-based word reordering and dropping component, and a neural machine translation system. Gloss-to-pose conversion occurs using data from a lexicon for three different signed languages, with skeletal poses extracted from videos. To generate a sentence, the text-to-gloss system is first run, and the pose representations of the resulting signs are stitched together.

研究动机与目标

  • 为解决语音转手语翻译领域缺乏标准化、可复现基线的问题,该问题阻碍了比较评估和创新。
  • 通过提供开源工具和模块化流水线架构,降低新研究者的入门门槛。
  • 提升手语翻译系统的可访问性和可扩展性,特别是在资源有限的环境中。
  • 通过共享的、社区维护的框架,实现新方法的系统性评估与基准测试。
  • 通过提供后编辑和扩展的基础,支持更准确、更自然的手语生成。

提出的方法

  • 该系统采用三阶段流水线:文本到词素翻译、词素到姿态转换、姿态到视频动画。
  • 在文本到词素翻译方面,实现了三个独立组件:词干化器、基于规则的词序重排与删除模块,以及使用 MeineDGS 语料库的神经机器翻译(NMT)系统。
  • 词素到姿态的转换使用了包含提取骨骼姿态的手语视频词典,应用了包括裁剪、拼接和光滑处理在内的预处理步骤。
  • 通过按词素顺序拼接单个手语姿态,生成姿态序列,以保持时间与空间对齐。
  • 姿态到视频生成步骤利用最先进的姿态到视频模型,从姿态序列合成最终视频。
  • 整个系统作为开源项目发布于 GitHub,支持社区贡献、可复现性和可扩展性。

实验结果

研究问题

  • RQ1如何建立一个可复现的、开源的语音转手语翻译基线,以支持比较研究和社区开发?
  • RQ2在生成准确词素序列方面,不同文本到词素翻译组件——词干化、基于规则的词序重排/删除、神经机器翻译——的相对优势与局限性是什么?
  • RQ3基于词典的词素到姿态转换在使用骨骼姿态数据时,能在多大程度上生成自然流畅的手语动画?
  • RQ4如何以可扩展且语言学上合理的方式,有效处理未知词素、变体(如复数形式)和专有名词?
  • RQ5如何通过后编辑或基于扩散模型的优化,改进姿态序列以增强流畅度与自然度?

主要发现

  • 所提出的流水线成功为德语、法语和意大利语输入文本生成了手语视频,展示了在瑞士三种手语中的可行性。
  • 基于 NMT 的文本到词素组件生成了语义消歧的词素 ID,相比基于规则或词干化的方法,显著提升了语义准确性。
  • 使用词典提取的骨骼姿态进行词素到姿态转换,实现了可靠、数据驱动的动画生成,预处理步骤有效提升了姿态质量和连续性。
  • 系统通过与 SignWriting 或 HamNoSys 等书写系统进行模糊匹配,支持未知词素的处理,并可借助 Ham2Pose 等模型生成视频。
  • 在 GitHub 上的开源发布支持了社区协作、可复现性和可扩展性,未来计划通过在真实与合成姿态序列上训练的扩散模型支持后编辑功能。
  • 该框架为未来工作奠定了基础,包括词素语义消歧、形态变体处理(如复数形式)以及词性转换。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。