QUICK REVIEW
[论文解读] Progress in animation of an EMA-controlled tongue model for acoustic-visual speech synthesis
Ingmar Steiner, Slim Ouni|arXiv (Cornell University)|Jan 19, 2012
Phonetics and Phonology Research参考文献 16被引用 3
一句话总结
本文提出一种用于声学-视觉语音合成中3D运动学舌头模型的骨骼动画技术,利用电磁动觉测量(EMA)运动捕捉数据与MRI获取的解剖结构。该方法通过将EMA线圈轨迹映射到可变形网格上的嵌入式B-骨骼骨架,实现无需生物力学建模的逼真、数据驱动的舌头动画。
ABSTRACT
We present a technique for the animation of a 3D kinematic tongue model, one component of the talking head of an acoustic-visual (AV) speech synthesizer. The skeletal animation approach is adapted to make use of a deformable rig controlled by tongue motion capture data obtained with electromagnetic articulography (EMA), while the tongue surface is extracted from volumetric magnetic resonance imaging (MRI) data. Initial results are shown and future work outlined.
研究动机与目标
- 通过集成逼真的3D舌头模型,提升声学-视觉文本到语音(AV-TTS)系统的视觉自然度与可懂度。
- 解决现有AV-TTS系统中缺乏口内构音数据的问题,目前系统通常省略舌头与牙齿。
- 开发一种基于EMA运动捕捉与MRI获取解剖结构的、非生物力学的数据驱动舌头动画方法。
- 利用现成的3D软件实现实时、同步的说话头GUI中舌头动画。
- 为通过基于动作的动画控制方式,将舌头模型直接集成至TTS系统奠定基础。
提出的方法
- 舌头模型基于高分辨率3D体素MRI数据构建,提供解剖学几何结构。
- 在舌头网格中嵌入由B-骨骼组成的骨骼绑定系统,为每个骨骼分配顶点组以实现形变控制。
- 使用Carstens AG500系统(200 Hz)采集的EMA运动捕捉数据,追踪舌头上最多12个线圈的三维位置与方向,提供稀疏但丰富的运动学数据。
- 对骨骼绑定系统应用逆向运动学(IK),基于EMA线圈轨迹驱动网格动画,实现逼真的形变。
- 在中性绑定姿态下将模型与EMA数据进行配准,手动将线圈位置对齐至网格顶点。
- 使用Blender中的基于关键帧的非线性动画(NLA)动作导出动画流程,实现向轻量级游戏引擎的可移植性,支持实时渲染。
实验结果
研究问题
- RQ1能否在无生物力学约束的条件下,有效利用EMA运动捕捉数据驱动3D舌头模型动画?
- RQ2如何将稀疏的EMA数据映射到密集的3D网格,以生成合理的舌头形变?
- RQ3结合MRI解剖结构,采用灵活的B-骨骼绑定的骨骼动画方法能否实现逼真的舌头运动?
- RQ4在不同说话者之间,如何实现EMA线圈位置与MRI获取的舌头网格之间的对齐?
- RQ5如何减轻EMA数据中的误差与异常值,以确保动画的稳定与自然外观?
主要发现
- 该技术成功利用EMA数据与MRI解剖结构生成合理的舌头动画,初步结果在重复[ta]音素构音中显示出视觉合理性。
- 利用EMA线圈的方向数据有助于补偿位置数据的稀疏性,提升动画稳定性。
- 手动将MRI网格与EMA线圈位置配准导致拟合效果不理想,表明亟需改进自动配准方法。
- 采用B-骨骼与IK的骨骼动画方法可在无需物理模拟的情况下实现舌头网格的真实形变。
- 动画流程可通过标准格式(如COLLADA)导出,支持集成至实时游戏引擎,实现高效GUI渲染。
- 未来工作将聚焦于自动配准、EMA数据清洗,以及通过基于动作的控制方式实现与TTS系统的直接集成。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。