[论文解读] Modeling Intensification for Sign Language Generation: A Computational Approach
本文提出一种数据驱动的计算方法,通过在词素注释中增强语言层面的强度修饰符,以建模手语生成中的强度增强。基于 PHOENIX-14T 的一个子集,作者使用有监督的强度标注器将强度标签扩展至整个数据集,并微调了一个渐进式 Transformer 模型,从而在自动指标上表现更优,且生成的手语视频在人类偏好测试中表现更佳,其语调也更为准确。
End-to-end sign language generation models do not accurately represent the prosody in sign language. A lack of temporal and spatial variations leads to poor-quality generated presentations that confuse human interpreters. In this paper, we aim to improve the prosody in generated sign languages by modeling intensification in a data-driven manner. We present different strategies grounded in linguistics of sign language that inform how intensity modifiers can be represented in gloss annotations. To employ our strategies, we first annotate a subset of the benchmark PHOENIX-14T, a German Sign Language dataset, with different levels of intensification. We then use a supervised intensity tagger to extend the annotated dataset and obtain labels for the remaining portion of it. This enhanced dataset is then used to train state-of-the-art transformer models for sign language generation. We find that our efforts in intensification modeling yield better results when evaluated with automatic metrics. Human evaluation also indicates a higher preference of the videos generated using our model.
研究动机与目标
- 为解决端到端手语生成模型中语调变化不足的问题,特别是强度修饰符的表示问题。
- 识别基于语言学的策略,用于在词素注释中编码强度调节器(例如 'very'、'little')。
- 开发一种有监督的强度标注器,将强度标签扩展至 PHOENIX-14T 数据集中未标注的部分。
- 将增强强度的词素注释整合到最先进的 Transformer 模型中,以提升手语视频生成质量。
- 评估强度增强建模对自动指标与人类对生成手语视频感知的影响。
提出的方法
- 基于手语语调的语言学与认知科学原理,对 PHOENIX-14T 的一个子集进行强度等级(例如:低、中、高)标注。
- 使用标注子集训练有监督的强度标注器,以预测数据集中剩余未标注词素的强度等级。
- 通过在词素中附加强度标签,增强整个 PHOENIX-14T 数据集,创建一个全新的、增强的训练资源。
- 使用增强后的数据集微调一个渐进式 Transformer(PT)模型,将强度标签作为输入上下文。
- 提出一种新颖的动态姿态选择机制,根据输入词素中的强度等级自适应调整生成的手语姿态。
- 通过自动指标(BLEU、METEOR、ROUGE、CIDER)和人类评估(视频质量与强度表示)对模型进行评估。
实验结果
研究问题
- RQ1如何基于语言学原理,在词素注释中系统性地建模并表示手语中的强度修饰符?
- RQ2在词素中添加强度标签在多大程度上能提升手语生成的自动指标表现?
- RQ3根据人类评估,建模强度增强是否能生成更具感知质量的手语视频?
- RQ4与基线模型相比,强度感知模型在生成手语视频中保持语义强度方面表现如何?
- RQ5n-gram 基自动指标在评估手语生成中强度表示时存在哪些缺陷?
主要发现
- 增强后的模型在 'with intensification' 测试集上四项自动指标(BLEU、METEOR、ROUGE、CIDER)均达到 100%,而基线模型的得分范围为 55.7%–81.9%。
- 人类评估显示,对使用强度增强模型生成的视频偏好度显著更高,表明其感知质量与语调表现更优。
- 在定性分析中,模型在 30% 的案例中正确表示了强度修饰符,优于基线模型在保持语义强度方面的表现。
- 尽管有所改进,仍有 23% 的案例显示自动指标未能奖励更好的强度表示,凸显了指标的局限性。
- 模型在 3% 的案例中偶尔会幻觉性地生成强度修饰符,表明强度标注存在过度生成的风险。
- 本研究证明,基于语言学的强度建模能显著提升手语生成在定量与定性层面的表现。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。