Skip to main content
QUICK REVIEW

[論文レビュー] Auxiliary Function-Based Algorithm for Blind Extraction of a Moving Speaker

Jakub Janský, Zbyněk Koldovský|arXiv (Cornell University)|Feb 28, 2020
Blind Source Separation Techniques被引用数 4
ひとこと要約

本稿では、反響と騒音環境下での動く話者を追跡するための、定数分離ベクトル(CSV)モデルに基づく新しい盲目的音源抽出(BSE)アルゴリズム、Block AuxIVEを提案する。補助関数に基づく最適化を活用することで、オンライン追跡を不要としつつも、収束が速く、ロバストな抽出が可能となり、実世界およびCHiME-4ベンチマーク条件下で静的モデルを上回る性能を発揮する。

ABSTRACT

Recently, Constant Separating Vector (CSV) mixing model has been proposed for the Blind Source Extraction (BSE) of moving sources. In this paper, we experimentally verify the applicability of CSV in the blind extraction of a moving speaker and propose a new BSE method derived by modifying the auxiliary function-based algorithm for Independent Vector Analysis. Also, a piloted variant is proposed for the method with partially controllable global convergence. The methods are verified under reverberant and noisy conditions using {\color{red} simulated as well as real-world acoustic conditions}. They are also verified within the CHiME-4 speech separation and recognition challenge. The experiments corroborate the applicability of CSV as well as the improved convergence of the proposed algorithms.

研究の動機と目的

  • 時間とともに変化する話者位置を伴うマルチマイク音響環境において、動く話者の盲目的抽出の課題に対処すること。
  • 短時間の間、異なる静的混合モデルへの切り替えによって生じるオンラインBSEにおける不連続性問題を克服すること。
  • 明示的な話者追跡を伴わず、話者が移動しても目標音源の抽出が一貫して維持されるBSE手法を開発すること。
  • 特に過決定マイクアレイにおいて、勾配ベースのBSE手法と比較して収束速度とグローバル収束安定性を向上させること。
  • シミュレーテッドおよび実世界データ(CHiME-4チャレンジデータセット含む)を用いて、高反響・高騒音環境下での手法のロバスト性を検証すること。

提案手法

  • 話者が移動する経路全体にわたり、時間的に不変の分離フィルタが一つで目標音源を抽出できると仮定する定数分離ベクトル(CSV)混合モデルを採用する。
  • 収束が勾配ベースの手法よりも速いことを目指し、補助関数最適化に基づくブロックワイズBSEアルゴリズムであるBlock AuxIVEを提案する。
  • 周波数ごとに即時の混合とみなせるように、STFTドメインで畳み込み混合をモデル化し、周波数ビン間での効率的な同時処理を可能にする。
  • 補助関数法を適用して、目的関数の単調収束を保証する固定点更新則を導出する。
  • パイロット信号(残り音源を含む部分的に事前に抽出された目標音源)を用いた半教師ありバージョンを導入し、グローバル収束を安定化させる。
  • 初期化に相対伝達関数(RTF)推定を用い、比較系では盲目的解析正規化(BAN)をポストフィルタとして適用する。

実験結果

リサーチクエスチョン

  • RQ1CSVモデルは、明示的な話者追跡を伴わず、動く話者の抽出に有効であるか。また、動的環境下での静的混合モデルと比較してどのように異なるか。
  • RQ2提案された補助関数に基づくアルゴリズム(Block AuxIVE)は、勾配ベースのBSE手法と比較して収束が速く、より優れたグローバル収束を達成するか。
  • RQ3Block AuxIVEアルゴリズムは、反響、騒音、不完全な初期化の影響を受ける実世界およびシミュレーテッド音響環境において、どの程度ロバストか。
  • RQ4パイロット信号に顕著な残りノイズや干渉がある場合でも、パイロット信号を用いた半教師ありバージョンは安定なグローバル収束を確保できるか。
  • RQ5CHiME-4チャレンジのような実世界ベンチマークにおいて、特に動く話者シナリオにおいてBlock AuxIVEの性能はいかがなものか。

主な発見

  • Block AuxIVEは平均7イタレーションで収束し、CHiME-4全データセットの処理時間を10時間30分(BOGIVE w)から1時間2分に短縮した。
  • 実テストデータセットでは語誤り率(WER)が6.44%、シミュレーテッドテストデータセットでは6.46%を達成し、過剰な音源分散(OverIVA)(10.43%および6.82%)やGEV(8.10%および5.99%)を一部の条件下で上回った。
  • Block AuxIVEは話者移動時にも音声を正常に回復できるが、図5に示すように、固定ビームフォーミングのためOverIVAは話者が移動すると音声が途切れてしまう。
  • パイロット信号を用いた半教師ありバージョンは、パイロットに顕著な残りノイズや干渉が含まれても、安定したグローバル収束を達成した。
  • CSVベースのアプローチにより、話者が移動しても一貫した抽出が可能となり、フレーム単位の静的モデル適用に起因する不連続性問題を回避できた。
  • 訓練データを一切必要とせず、学習済みGEVビームフォーマーと同等の性能を達成した。これは、盲目的状況下でも優れた一般化性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。