Skip to main content
QUICK REVIEW

[论文解读] Changing the Representation: Examining Language Representation for Neural Sign Language Production

Harry Walsh, Ben Saunders|arXiv (Cornell University)|Sep 16, 2022
Hand Gesture Recognition Systems被引用 9
一句话总结

本论文通过重新思考语言表征方式,改进了神经手语生成:提出使用音素化手语表征而非词素的文本到HamNoSys(T2H)翻译,结合BERT与Word2Vec生成上下文句子嵌入,采用BPE与子词分词,利用HamNoSys中的手部形状信息作为监督信号。该方法在mDGS与PHOENIX14T数据集上分别取得26.99与25.09的SOTA BLEU-4得分,显著优于先前工作。

ABSTRACT

Neural Sign Language Production (SLP) aims to automatically translate from spoken language sentences to sign language videos. Historically the SLP task has been broken into two steps; Firstly, translating from a spoken language sentence to a gloss sequence and secondly, producing a sign language video given a sequence of glosses. In this paper we apply Natural Language Processing techniques to the first step of the SLP pipeline. We use language models such as BERT and Word2Vec to create better sentence level embeddings, and apply several tokenization techniques, demonstrating how these improve performance on the low resource translation task of Text to Gloss. We introduce Text to HamNoSys (T2H) translation, and show the advantages of using a phonetic representation for sign language translation rather than a sign level gloss representation. Furthermore, we use HamNoSys to extract the hand shape of a sign and use this as additional supervision during training, further increasing the performance on T2H. Assembling best practise, we achieve a BLEU-4 score of 26.99 on the MineDGS dataset and 25.09 on PHOENIX14T, two new state-of-the-art baselines.

研究动机与目标

  • 通过改进文本到词素(T2G)翻译中的句子级表征,提升低资源手语翻译性能。
  • 探究通过HamNoSys实现的音素化表征是否在手语翻译中优于传统的词素级表征。
  • 评估不同分词策略(BPE、WordPiece、词级、字符级)对手语翻译性能的影响。
  • 探索预训练语言模型(BERT、Word2Vec)在低资源手语翻译中提升上下文句子嵌入质量的潜力。
  • 整合来自HamNoSys的手部形状信息作为辅助监督信号,以提升模型性能。

提出的方法

  • 作者应用BERT与Word2Vec生成手语翻译的上下文句子嵌入,提升表征质量。
  • 对比多种分词方法——BPE、WordPiece、词级与字符级,以确定低资源手语翻译中的最优分词策略。
  • 提出一种新颖的文本到HamNoSys(T2H)翻译任务,其中手语通过音素化的汉堡记号系统(HamNoSys)表征,捕捉初始姿态、手部形状与动作特征。
  • 从HamNoSys中提取的手部形状信息在训练过程中作为额外监督信号,以改善对齐与性能。
  • 模型架构结合双向LSTM与注意力机制,并采用交叉熵损失与课程采样策略进行序列生成。
  • 该框架在两个基准数据集mDGS与PHOENIX14T上进行训练与评估,以BLEU-4为主要指标。

实验结果

研究问题

  • RQ1与词素级表征相比,使用如HamNoSys这样的音素化表征是否能提升手语翻译性能?
  • RQ2在低资源手语翻译中,哪种分词策略(BPE、WordPiece、词级、字符级)表现最佳?
  • RQ3预训练语言模型如BERT与Word2Vec是否能显著改善手语翻译中的句子级嵌入?
  • RQ4将来自HamNoSys的手部形状信息作为辅助监督信号,是否能提升翻译质量?
  • RQ5通过改进语言表征与分词策略,在mDGS与PHOENIX14T上可达到的SOTA性能水平如何?

主要发现

  • 所提出的文本到HamNoSys(T2H)方法在mDGS数据集上取得26.99的BLEU-4得分,创下新的SOTA基准。
  • 在PHOENIX14T数据集上,模型达到25.09的BLEU-4得分,显著优于先前工作报告的SOTA得分3.17。
  • 使用BERT与Word2Vec嵌入可提升句子级表征质量,从而在低资源环境下增强翻译性能。
  • BPE分词在所有测试分词策略中表现最优,简化了翻译任务并提升了泛化能力。
  • 将来自HamNoSys的手部形状信息作为辅助监督信号可进一步提升性能,证明了结构化手语特征在序列建模中的价值。
  • 最优分词、预训练嵌入与通过HamNoSys实现的音素化表征三者结合,为mDGS与PHOENIX14T数据集建立了新的SOTA基线。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。