Skip to main content
QUICK REVIEW

[论文解读] Speech animation using electromagnetic articulography as motion capture data

Ingmar Steiner, Korin Richmond|arXiv (Cornell University)|Oct 30, 2013
Phonetics and Phonology Research参考文献 19被引用 3
一句话总结

本文提出了一种轻量级、基于动作捕捉的语音发音器官动画方法,以电磁言语图仪(EMA)数据作为输入。通过将 EMA 传感器线圈位置视为 BVH 兼容工作流程中的骨骼关节,作者生成了与实测 EMA 轨迹相关性达 95% 的逼真 3D 舌部和下颌动画,实现了实时可视化,并可利用开源工具集成到多媒体及音视频合成应用中。

ABSTRACT

Electromagnetic articulography (EMA) captures the position and orientation of a number of markers, attached to the articulators, during speech. As such, it performs the same function for speech that conventional motion capture does for full-body movements acquired with optical modalities, a long-time staple technique of the animation industry. In this paper, EMA data is processed from a motion-capture perspective and applied to the visualization of an existing multimodal corpus of articulatory data, creating a kinematic 3D model of the tongue and teeth by adapting a conventional motion capture based animation paradigm. This is accomplished using off-the-shelf, open-source software. Such an animated model can then be easily integrated into multimedia applications as a digital asset, allowing the analysis of speech production in an intuitive and accessible manner. The processing of the EMA data, its co-registration with 3D data from vocal tract magnetic resonance imaging (MRI) and dental scans, and the modeling workflow are presented in detail, and several issues discussed.

研究动机与目标

  • 通过将 EMA 数据作为动作捕捉输入,实现实时、直观的语音发音过程可视化。
  • 通过直接利用现有 EMA 数据,克服基于规则或生物力学复杂的模型的局限性。
  • 开发一种轻量级、开源的管道,将发音动画集成到多媒体及音视频语音合成系统中。
  • 通过将 EMA 与受试者特异性的 MRI 和牙科扫描进行共注册,避免跨说话者归一化问题。
  • 证明可利用现成的 3D 软件实现发音动画,而无需自定义仿真框架。

提出的方法

  • 使用 BVH 文件格式将 mngu0 语料库中的 EMA 数据处理为动作捕捉输入,以确保与标准动画工具的兼容性。
  • 基于同一受试者的高分辨率 MRI 和牙科扫描数据,创建了 3D 舌部网格,以确保解剖学准确性和受试者特异性。
  • 采用样条曲线逆运动学(IK)对基于 NURBS 的舌部模型进行形变,其中 EMA 传感器线圈位置驱动样条曲线上的控制点。
  • 使用骨骼绑定系统对舌部进行绑定,网格上的顶点组按权重跟随形变后的样条曲线,实现平滑形变。
  • 应用简单的铰链式修改器,基于下颌切牙处的 EMA 传感器线圈数据对下颌进行动画处理。
  • 通过腭部轮廓作为参考,手动完成 EMA、MRI 和牙科扫描数据的共注册,确保空间对齐。

实验结果

研究问题

  • RQ1能否有效将 EMA 数据重新用作动作捕捉数据,驱动标准动画工作流中的逼真 3D 发音动画?
  • RQ2在网格拓扑稀疏的情况下,EMA 驱动的动画在多大程度上能保持实际发音运动的运动学特征?
  • RQ3与通用模型相比,使用受试者特异性的 MRI 和牙科扫描在多大程度上提升了生成动画的解剖学保真度?
  • RQ4直接将 EMA 传感器线圈位置用作动画驱动时,其主要局限性是什么,尤其是在线圈位置和数据噪声方面?
  • RQ5能否仅使用开源、现成的工具实现功能性的、实时的发音动画系统,而无需自定义生物力学建模?

主要发现

  • EMA 驱动的动画在测量 EMA 传感器线圈轨迹与动画舌部网格上对应顶点之间的平均相关性达到 0.95。
  • 尽管舌部网格拓扑稀疏,动画仍保留了自然语音运动的整体运动学特征。
  • 通过使用受试者特异性的 MRI 和牙科扫描创建模型,该方法成功避免了跨说话者归一化问题。
  • 采用 BVH 兼容数据和开源工具(如 Blender)实现了轻量级、可复现且可集成的动画管道。
  • 该方法证明了在实时可视化及音视频语音合成系统中集成的可行性,尽管 MRI(仰卧位)与 EMA(直立位)之间的姿势差异可能影响舌部形状保真度。
  • 仍存在若干挑战,包括 MRI 数据的手动分割、易出错的手动共注册、缺乏碰撞检测,以及对初始绑定姿态和线圈位置的敏感性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。