Skip to main content
QUICK REVIEW

[论文解读] G2P-DDM: Generating Sign Pose Sequence from Gloss Sequence with Discrete Diffusion Model

Pan Xie, Qipeng Zhang|arXiv (Cornell University)|Aug 19, 2022
Hand Gesture Recognition Systems被引用 4
一句话总结

本文提出 G2P-DDM,一种新颖的离散扩散模型,通过首先使用多码本 Pose-VQVAE 将连续姿态序列转换为离散标记,从而从词汇序列生成手语姿态序列。该方法采用基于 CodeUnet 架构的离散去噪扩散模型(G2P-DDM)以建模时空依赖性,并结合启发式聚类方法实现可变长度序列生成,在 RWTH-PHOENIX-WEATHER-2014T 基准上实现了 77.26% 的 WER 和优越的人工评估结果,达到当前最优性能。

ABSTRACT

The Sign Language Production (SLP) project aims to automatically translate spoken languages into sign sequences. Our approach focuses on the transformation of sign gloss sequences into their corresponding sign pose sequences (G2P). In this paper, we present a novel solution for this task by converting the continuous pose space generation problem into a discrete sequence generation problem. We introduce the Pose-VQVAE framework, which combines Variational Autoencoders (VAEs) with vector quantization to produce a discrete latent representation for continuous pose sequences. Additionally, we propose the G2P-DDM model, a discrete denoising diffusion architecture for length-varied discrete sequence data, to model the latent prior. To further enhance the quality of pose sequence generation in the discrete space, we present the CodeUnet model to leverage spatial-temporal information. Lastly, we develop a heuristic sequential clustering method to predict variable lengths of pose sequences for corresponding gloss sequences. Our results show that our model outperforms state-of-the-art G2P models on the public SLP evaluation benchmark. For more generated results, please visit our project page: extcolor{blue}{\url{https://slpdiffusier.github.io/g2p-ddm}}

研究动机与目标

  • 为解决在手语生成(SLP)中从口语词汇序列生成准确且可变长度的手语姿态序列的挑战。
  • 通过引入非自回归、迭代优化的方法,克服现有 G2P 模型中误差传播和自回归解码缓慢的问题。
  • 通过使用专为多码本设计的 VQ-VAE 架构将连续姿态空间转换为离散潜在空间,以提升姿态序列生成质量。
  • 通过专为可变长度序列设计的离散去噪扩散框架,建模词汇与姿态序列之间的复杂序列对齐关系。
  • 通过提出基于序列 KNN 的聚类方法,解决可变长度生成问题,实现长度预测。

提出的方法

  • 引入 Pose-VQVAE,通过将骨架划分为三个局部区域(姿态、右手、左手),每个区域使用独立的码本,以保留空间语义并提升重建质量,实现对连续手语姿态序列的离散化。
  • 应用离散去噪扩散模型(G2P-DDM)于离散潜在码本序列,通过逆转一个逐步掩码标记的前向破坏过程,实现序列的迭代优化。
  • 采用 CodeUnet 架构,一种专为离散序列设计的全 Transformer 结构,用于建模潜在码本序列中的时空依赖性,从而提升生成质量。
  • 提出一种基于 k-最近邻密度峰值的启发式序列聚类方法,用于检测姿态序列中的边界,实现对可变长度词汇序列的准确长度预测。
  • 在推理过程中,通过将词汇序列长度作为额外输入进行监督,进一步提升长度预测的准确性,增强对齐效果与生成保真度。
  • 整个流程采用两阶段训练:首先预训练 Pose-VQVAE 以学习离散码本,随后使用 CodeUnet 对 G2P-DDM 进行微调,实现条件生成。

实验结果

研究问题

  • RQ1离散扩散建模能否有效生成条件于词汇序列的可变长度手语姿态序列,并优于自回归基线方法?
  • RQ2将姿态表示按局部区域(如双手与身体)分离并使用独立码本,对重建与生成质量有何影响?
  • RQ3与标准 Transformer 相比,专用离散序列模型(如 CodeUnet)在离散潜在空间中对时空建模的提升程度如何?
  • RQ4基于启发式聚类的方法能否在无显式长度监督的情况下,有效预测手语姿态序列的长度?
  • RQ5离散 VQ-VAE 与扩散建模的结合,如何提升非自回归 G2P 生成的质量并减少误差传播?

主要发现

  • 采用分离码本(1024×3)的 Pose-VQVAE 在重建性能上表现最佳,MSE 达到 0.0113,显著优于共享码本与联合压缩的变体。
  • 在 RWTH-PHOENIX-WEATHER-2014T 基准上,使用 CodeUnet 的 G2P-DDM 模型实现了 77.26% 的 WER,优于先前的 SOTA 方法。
  • 人工评估显示,350 名参与者中有 319 名更偏好 G2P-DDM 生成的序列,表明其具有优异的感知质量与自然度。
  • 消融实验表明,为局部姿态区域使用独立码本可减少特征混淆,提升重建质量,T-SNE 可视化与更低的 MSE 值验证了该结论。
  • 将推理步数从 20 增加至 200 可进一步提升 WER 表现,且在 100 步后趋于饱和,因此选择 100 步作为质量与速度之间的折中。
  • 在相同扩散设置下,CodeUnet 比标准 Transformer 收敛更快且性能更优,证明其在结构化离散序列建模中的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。