Skip to main content
QUICK REVIEW

[論文レビュー] Variational Bayesian Inference for Audio-Visual Tracking of Multiple Speakers

Yutong Ban, Xavier Alameda-Pineda|arXiv (Cornell University)|Sep 28, 2018
Speech and Audio Processing参考文献 36被引用数 5
ひとこと要約

本稿では、動的で非形式的な会議における複数話者の音声視覚追跡のための変分ベイジアン推論フレームワークを提案する。視覚的および聴覚的観測を潜在変数時系列グラフィカルモデルでモデル化することで、欠損またはノイズの多いデータを含む両モダリティに対しても、トラック、関連付け、音声状態(発話中/沈黙中)を同時に推定する、実行可能な変分EMアルゴリズムを用いる。

ABSTRACT

In this paper we address the problem of tracking multiple speakers via the fusion of visual and auditory information. We propose to exploit the complementary nature of these two modalities in order to accurately estimate smooth trajectories of the tracked persons, to deal with the partial or total absence of one of the modalities over short periods of time, and to estimate the acoustic status -- either speaking or silent -- of each tracked person along time. We propose to cast the problem at hand into a generative audio-visual fusion (or association) model formulated as a latent-variable temporal graphical model. This may well be viewed as the problem of maximizing the posterior joint distribution of a set of continuous and discrete latent variables given the past and current observations, which is intractable. We propose a variational inference model which amounts to approximate the joint distribution with a factorized distribution. The solution takes the form of a closed-form expectation maximization procedure. We describe in detail the inference algorithm, we evaluate its performance and we compare it with several baseline methods. These experiments show that the proposed audio-visual tracker performs well in informal meetings involving a time-varying number of people.

研究の動機と目的

  • 視覚的および聴覚的観測がしばしば不完全または損傷を受ける非形式的会議における複数話者の追跡という課題に対処する。
  • 視覚的および聴覚的モダリティの相補的利点を活用し、遮蔽、混响、重なり話しがある状況でも追跡のロバスト性を向上させる。
  • 時間経過に伴い、連続的な話者軌跡、離散的な観測-話者関連付け、および音声状態(発話中/沈黙中)を同時に推定する。
  • 正確なベイジアン推論では困難な高次元の後験分布に対して、計算的に実行可能な推論手法を開発する。
  • 新規話者を事前に観測されていなかった場合に検出可能な、出生プロセスを備えた因果的でリアルタイムの追跡を可能にする。

提案手法

  • 連続的(位置、速度)および離散的(関連付け、音声状態)な潜在変数を含む、生成的潜在変数時系列グラフィカルモデルとして音声視覚追跡問題を定式化する。
  • 複雑な結合後験分布をより単純で実行可能な分布の積に分解することで、不確実な結合後験分布を近似するための変分推論を適用する。
  • 後験分布の推定(Eステップ)とモデルパラメータの更新(Mステップ)を交互に繰り返す変分期待最大化(VEM)アルゴリズムを導出する。
  • 話者状態遷移と観測尤度にガウス過程事前分布を用い、Eステップにおける平均および共分散の閉形式更新を実現する。
  • 音声特徴をチャンネル間スペクトル特徴とサブバンド分解でモデル化し、音声特徴から空間的位置へのマッピングにガウス・ミックスチャネル・モデル(GMM)を用いる。
  • 未割り当ての観測に一様事前分布を設定した「null関連付け状態」(n=0)を介して出生プロセスを統合する。

実験結果

リサーチクエスチョン

  • RQ1部分的または完全なセンサ障害下でも、音声と視覚のモダリティを効果的に統合することで、複数話者の追跡のロバスト性を向上させることは可能か?
  • RQ2最小限のヒューリスティック閾値で、話者軌跡、観測関連付け、音声状態(発話中/沈黙中)を1つの生成的モデルが同時に推定できるか?
  • RQ3提案された変分推論フレームワークは、ノイズや不完全なデータ下でも、ベースライン手法に比べて追跡精度とロバスト性でどれほど優れているか?
  • RQ4時間的に変化する参加者数を伴う動的会議において、話者の「出生」(新規登場)と「死」(退場)をモデルはどの程度適切に処理できるか?
  • RQ5サブバンド分解とGMMベースの音声-位置マッピングを用いることで、局所化精度と追跡安定性にどのような影響があるか?

主な発見

  • 提案された変分ベイジアントラッカーは、特に遮蔽や混ぜ声の状況下でも、ベースライン手法に比べて追跡精度と話者ダイアライゼーションの両面で優れた性能を示す。
  • 一方のモダリティからの欠損または損傷したデータに対しても、もう一方のモダリティの補完的情報に依存することで、短時間のセンサ障害時でも安定した追跡を維持できる。
  • 出生プロセスの統合により、事前に話者数を定義する必要なく、新規話者の検出が可能になる。
  • サブバンド分解とGMMベースの音声-位置マッピングの使用は、特に混ぜ声環境下で局所化精度を顕著に向上させる。
  • VEMアルゴリズムは効率的に収束し、動的で社会的な相互作用に適した因果的でリアルタイムの追跡ソリューションを提供する。
  • 定量的評価では、ベンチマークデータセット上での話者ダイアライゼーションのF1スコアが向上し、最先端手法に比べて複数対象追跡(MOT)誤差が低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。