[论文解读] Sign Language Translation with Hierarchical Spatio-TemporalGraph Neural Network
该论文提出了一种分层时空图神经网络(HST-GNN)用于手语翻译(SLT),通过细粒度(关节)和高层次(身体区域)图来建模手语,以捕捉局部和全局的时空依赖关系。该方法在Phoenix-2014-T和CSL基准测试中取得了最先进性能,测试集上的词错误率(WER)为19.5,BLEU-1得分为46.1。
Sign language translation (SLT), which generates text in a spoken language from visual content in a sign language, is important to assist the hard-of-hearing community for their communications. Inspired by neural machine translation (NMT), most existing SLT studies adopted a general sequence to sequence learning strategy. However, SLT is significantly different from general NMT tasks since sign languages convey messages through multiple visual-manual aspects. Therefore, in this paper, these unique characteristics of sign languages are formulated as hierarchical spatio-temporal graph representations, including high-level and fine-level graphs of which a vertex characterizes a specified body part and an edge represents their interactions. Particularly, high-level graphs represent the patterns in the regions such as hands and face, and fine-level graphs consider the joints of hands and landmarks of facial regions. To learn these graph patterns, a novel deep learning architecture, namely hierarchical spatio-temporal graph neural network (HST-GNN), is proposed. Graph convolutions and graph self-attentions with neighborhood context are proposed to characterize both the local and the global graph properties. Experimental results on benchmark datasets demonstrated the effectiveness of the proposed method.
研究动机与目标
- 通过实现高精度手语翻译(SLT),弥合聋哑/听力障碍手语使用者与口语使用者之间的沟通鸿沟。
- 克服现有序列到序列模型在SLT中难以建模多部位间复杂时空交互的局限性。
- 将手语形式化为分层时空图,以表示细粒度关节级与高层次区域级的交互关系。
- 设计一种新型深度学习架构(HST-GNN),集成图卷积与图自注意力机制,并结合邻域上下文,实现鲁棒的表征学习。
- 通过全面的消融实验与定性分析,验证所提方法在基准SLT数据集上的有效性。
提出的方法
- 使用身体部位(如手部)的关节点坐标构建细粒度时空图,使用关键区域(如面部、手部)的外观、运动或姿态特征构建高层次图。
- 将图卷积与图自注意力机制结合邻域上下文,以同时建模局部与全局图属性。
- 设计编码器-解码器框架,其中编码器通过图卷积与自注意力处理分层图,解码器从学习到的嵌入表示生成口语文本。
- 采用基于邻接矩阵的连接机制,以在细粒度与高层次图中保持节点(身体部位)之间的结构关系。
- 引入时间窗口机制(最优窗口大小为3),以捕捉短期依赖关系,同时最小化长程历史数据带来的噪声。
- 在训练过程中应用CTC损失进行对齐监督,以提升词素预测的准确性。

实验结果
研究问题
- RQ1如何通过图表示有效建模手语的多模态、时空特性?
- RQ2与单独建模相比,同时整合空间与时间图结构对SLT性能的影响如何?
- RQ3与平面或单层图方法相比,分层图建模(细粒度与高层次)在手语表征方面有何提升?
- RQ4图卷积与结合邻域上下文的图自注意力机制在SLT中对特征学习的增强程度如何?
- RQ5为捕捉有意义的手语动态,最优的时间窗口大小是多少,以避免引入噪声?
主要发现
- 所提出的HST-GNN在Phoenix-2014-T数据集上取得了最先进性能,测试集WER为19.5,BLEU-1得分为46.1。
- 在CSL数据集上,模型取得了WER 27.6与BLEU-1 49.1的性能,表明其在不同手语数据集上具有强大的泛化能力。
- 消融实验表明,同时结合空间与时间图建模显著优于单一组件,完整HST-GNN优于所有消融变体。
- 分层建模组件进一步提升了性能,尤其在检测罕见或复杂词素方面表现突出,定性分析已验证此点。
- 最优时间窗口大小被确定为3,因更大窗口会因噪声增加与模型复杂度上升而降低性能。
- 定性结果表明,完整HST-GNN模型在测试样本中正确检测了所有词素,而基线模型与部分模型则存在漏检或误检词素的问题。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。