Skip to main content
QUICK REVIEW

[論文レビュー] Meeting Transcription Using Virtual Microphone Arrays

Takuya Yoshioka, Zhuo Chen|arXiv (Cornell University)|May 3, 2019
Speech and Audio Processing参考文献 30被引用数 15
ひとこと要約

本稿では、非同期で分散されたマイク(例:ラップトップ、スマートフォン)を用いて仮想マイクアレイを構築するリアルタイム会議音声認識システムを提示する。音声ストリームの同期、ブラインドビームフォーミング、音声認識、話者ダイアライゼーション、およびシステム結合(特にリーブ・オール・アウト・ビームフォーミングと段階的ROVER)を統合することで、22.3%の語誤り率(WER)と26.7%の話者属性付与WERを達成し、重複なしの会話において、密着マイク性能の3%以内に収まる。

ABSTRACT

We describe a system that generates speaker-annotated transcripts of meetings by using a virtual microphone array, a set of spatially distributed asynchronous recording devices such as laptops and mobile phones. The system is composed of continuous audio stream alignment, blind beamforming, speech recognition, speaker diarization using prior speaker information, and system combination. When utilizing seven input audio streams, our system achieves a word error rate (WER) of 22.3% and comes within 3% of the close-talking microphone WER on the non-overlapping speech segments. The speaker-attributed WER (SAWER) is 26.7%. The relative gains in SAWER over the single-device system are 14.8%, 20.3%, and 22.4% for three, five, and seven microphones, respectively. The presented system achieves a 13.6% diarization error rate when 10% of the speech duration contains more than one speaker. The contribution of each component to the overall performance is also investigated, and we validate the system with experiments on the NIST RT-07 conference meeting test set.

研究の動機と目的

  • 非同期で離れたマイクを用いた自然な会議環境における正確な話者属性付与音声認識の課題に取り組む。
  • 現実の会議環境において、単一マイクシステムや同期アレイ設定の限界を克服する。
  • フロントエンドのビームフォーミングとバックエンドのシステム結合を統合した低遅延でリアルタイムのシステムを構築し、より高品質な音声認識を実現する。
  • 非同期マルチマイク環境におけるリーブ・オール・アウト・ビームフォーミングと多様性を保全する統合戦略の有効性を調査する。
  • NIST RT-07会議データの実世界データを用いて、WER、SAWER、およびダイアライゼーション誤り率(DER)に注目して、システム性能を評価する。

提案手法

  • 処理の前段階で入力を同期するため、時間遅延推定と信号補正を用いて複数の非同期音声ストリームを同期化する。
  • 空間共分散行列を用いてブラインドビームフォーミングを適用し、マイク間で整合的な信号を組み合わせることで音声品質を向上させる。
  • リーブ・オール・アウト・ビームフォーミングを用いて複数のビームフォーマード信号を生成し、耐障害性を向上させるとともに、効果的なシステム結合を可能にする。
  • すべてのビームフォーマード信号に対して共同で自動音声認識(ASR)を実行し、語レベルのタイムスタンプを伴うn番目の最良仮説を生成する。
  • ASR後に話者埋め込みと語レベルのタイムマークを用いて話者ダイアライゼーションを実施し、トランスクリプトセグメントに話者ラベルを割り当てる。
  • リアルタイムで語の仮説と話者ラベルを統合する段階的ROVERベースのシステム結合を実装し、遅延を最小限に抑える。

実験結果

リサーチクエスチョン

  • RQ1リーブ・オール・アウト・ビームフォーミングを用いたシステム結合は、非同期マルチマイク会議音声認識における語誤り率と話者属性付与の正確性にどのように寄与するか?
  • RQ2マイク数の増加が、特にビームフォーミングとシステム結合を適用した場合、WERとSAWERに与える影響は何か?
  • RQ3ブラインドビームフォーミングと音声モデルの統合は、遠距離音声認識における語誤り率とダイアライゼーション誤り率をどの程度低減できるか?
  • RQ4リアルタイム話者属性付与トランスクリプションにおいて、高い正確性を維持しながら低遅延を実現する仕組みは何か?
  • RQ5非同期分散マイクと密着マイクとの間で、重複なしの会話セグメントにおいて性能差はどの程度あるか?

主な発見

  • 7台の入力マイクを用いた場合、語誤り率(WER)は22.3%に達し、重複なしの会話において密着マイク性能より3.0%絶対誤差でわずかに劣る。
  • 話者属性付与WER(SAWER)は26.7%であり、3台、5台、7台のマイクを用いた単一デバイスシステムと比較して、それぞれ14.8%、20.3%、22.4%の相対的改善を示した。
  • リーブ・オール・アウト・ビームフォーミングとシステム結合を組み合わせることで、CNC単体と比較してWERが5.8%相対的に低減し、標準的ビームフォーミングや単一デバイスベースラインを上回った。
  • NIST RT-07テストセットにおいて、ダイアライゼーション誤り率(DER)は13.6%を記録したが、10%の音声時間に重複会話が含まれており、これが多くが見逃されたセグメントの原因となっている。
  • ビームフォーミングは、マイクの録音品質にばらつきがある場合でも、入力信号品質を均一化することで、システム結合性能を顕著に向上させる。
  • 段階的ROVER処理とASR後のダイアライゼーションにより、低遅延を維持したまま、リアルタイム話者属性付与トランスクリプションを実現した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。