Skip to main content
QUICK REVIEW

[論文レビュー] Speech animation using electromagnetic articulography as motion capture data

Ingmar Steiner, Korin Richmond|arXiv (Cornell University)|Oct 30, 2013
Phonetics and Phonology Research参考文献 19被引用数 3
ひとこと要約

本稿では、磁気誘導式発話器具(EMA)データを入力として用いる、軽量でモーショングラフィクスに基づく発話の発音器アニメーション手法を提示する。EMAコイルの位置をBVH互換のワークフローにおけるスケルタルジョイントとして扱うことで、測定されたEMA軌道と95%の相関を示すリアルな3次元舌および下あごのアニメーションを生成し、オープンソースツールを用いてリアルタイムでの可視化およびマルチメディアおよび音声視覚合成アプリケーションへの統合を可能にする。

ABSTRACT

Electromagnetic articulography (EMA) captures the position and orientation of a number of markers, attached to the articulators, during speech. As such, it performs the same function for speech that conventional motion capture does for full-body movements acquired with optical modalities, a long-time staple technique of the animation industry. In this paper, EMA data is processed from a motion-capture perspective and applied to the visualization of an existing multimodal corpus of articulatory data, creating a kinematic 3D model of the tongue and teeth by adapting a conventional motion capture based animation paradigm. This is accomplished using off-the-shelf, open-source software. Such an animated model can then be easily integrated into multimedia applications as a digital asset, allowing the analysis of speech production in an intuitive and accessible manner. The processing of the EMA data, its co-registration with 3D data from vocal tract magnetic resonance imaging (MRI) and dental scans, and the modeling workflow are presented in detail, and several issues discussed.

研究の動機と目的

  • EMAデータをモーショングラフィクス入力として用いることで、発話発音のリアルタイムで直感的な可視化を可能にすること。
  • 従来のルールベースや生物学的力学的に複雑なモデルの限界を乗り越えるために、直接的に既存のEMAデータを活用すること。
  • マルチメディアおよびAV発話合成システムへの発音器アニメーション統合を可能にする、軽量でオープンソースのパイプラインを開発すること。
  • 被験者固有のMRIおよび歯科スキャンとEMAを共登録することで、異なる被験者間の正規化問題を回避すること。
  • カスタムシミュレーションフレームワークを必要とせず、市販の3次元ソフトウェアで発音器アニメーションを実現可能であることを示すこと。

提案手法

  • 標準のアニメーションツールとの互換性を確保するため、BVHファイル形式を用いてmngu0コーパスのEMAデータをモーショングラフィクス入力として処理した。
  • 被験者固有の解剖学的正確性を確保するため、同一被験者の高解像度MRIおよび歯科スキャンデータから3次元舌メッシュを生成した。
  • スプライン逆運動学(IK)を用いてNURBSベースの舌モデルを変形し、EMAコイル位置がスプライン上の制御点を駆動するようにした。
  • 変形されたスプラインに従ってメッシュ上の頂点グループが重み付けされるアーマチュアシステムを用いて舌をリギングし、滑らかな変形を実現した。
  • 下あごのアニメーションには、下顎切歯部のEMAコイルデータに基づく単純なヒンジベースの修飾子を適用した。
  • 上顎の輪郭を基準として、EMA、MRI、歯科スキャンデータの手動による共登録を実施し、空間的整合性を確保した。

実験結果

リサーチクエスチョン

  • RQ1標準のアニメーションパイプラインを用いて、EMAデータを効果的にモーショングラフィクス入力として再利用し、リアルな3次元発音器アニメーションを駆動できるか?
  • RQ2特にメッシュトポロジーが疎である場合に、EMA駆動アニメーションが実際の発音器運動の運動学的特性をどれほど正確に保持できるか?
  • RQ3被験者固有のMRIおよび歯科スキャンを用いることで、一般的なモデルと比較して、得られるアニメーションの解剖学的忠実度がどの程度向上するか?
  • RQ4特にコイルの配置とデータノイズの観点から、EMAコイル位置を直接アニメーションドライバとして使用する際の主な制限要因は何か?
  • RQ5カスタム生物学的力学モデリングを必要とせず、オープンソースの市販ツール(例:Blender)で、機能的でリアルタイムの発音器アニメーションシステムを構築できるか?

主な発見

  • EMA駆動アニメーションでは、測定されたEMAコイル軌道とアニメーション化された舌メッシュ上の対応する頂点との間に平均相関係数0.95を達成した。
  • 舌メッシュのトポロジーが疎であるにもかかわらず、自然な発話運動の全体的な運動学的特性が保持された。
  • 被験者固有のMRIおよび歯科スキャンを用いたことで、モデル作成時に異なる被験者間の正規化問題を効果的に回避できた。
  • BVH互換データとオープンソースツール(例:Blender)の使用により、軽量で再現可能かつ統合可能なアニメーションパイプラインが実現した。
  • 本手法は、リアルタイム可視化および音声視覚発話合成システムへの統合の可能性を示したが、MRI(仰臥位)とEMA(起立位)における姿勢の違いが舌形状の忠実度に影響を及ぼす可能性がある。
  • いくつかの課題が残っており、MRIデータの手動セグメンテーション、誤りを伴いやすい手動共登録、衝突検出の欠如、初期バインドポーズおよびコイル配置への感受性が挙げられる。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。