Skip to main content
QUICK REVIEW

[论文解读] Meeting Transcription Using Virtual Microphone Arrays

Takuya Yoshioka, Zhuo Chen|arXiv (Cornell University)|May 3, 2019
Speech and Audio Processing参考文献 30被引用 15
一句话总结

本论文提出了一种使用异步、分布式麦克风(如笔记本电脑、手机)构建虚拟麦克风阵列的实时会议转录系统。通过结合音频流对齐、盲波束成形、语音识别、说话人分割以及系统融合——包括留一法波束成形和增量式ROVER——本系统在非重叠语音场景下实现了22.3%的词错误率(WER)和26.7%的说话人归属词错误率(SAWER),与近讲麦克风性能相比仅低约3%。

ABSTRACT

We describe a system that generates speaker-annotated transcripts of meetings by using a virtual microphone array, a set of spatially distributed asynchronous recording devices such as laptops and mobile phones. The system is composed of continuous audio stream alignment, blind beamforming, speech recognition, speaker diarization using prior speaker information, and system combination. When utilizing seven input audio streams, our system achieves a word error rate (WER) of 22.3% and comes within 3% of the close-talking microphone WER on the non-overlapping speech segments. The speaker-attributed WER (SAWER) is 26.7%. The relative gains in SAWER over the single-device system are 14.8%, 20.3%, and 22.4% for three, five, and seven microphones, respectively. The presented system achieves a 13.6% diarization error rate when 10% of the speech duration contains more than one speaker. The contribution of each component to the overall performance is also investigated, and we validate the system with experiments on the NIST RT-07 conference meeting test set.

研究动机与目标

  • 解决在使用异步远距离麦克风的自然会议环境中实现高精度说话人归属语音识别的挑战。
  • 克服单麦克风系统和同步阵列设置在真实会议环境中存在的局限性。
  • 开发一种低延迟、实时的系统,结合前端波束成形与后端系统融合,以提升转录质量。
  • 研究在异步多麦克风环境下,留一法波束成形与保持多样性融合策略的有效性。
  • 在真实世界NIST RT-07会议数据上评估系统性能,重点关注WER、SAWER和分割错误率(DER)。

提出的方法

  • 使用时延估计与信号校正对多个异步音频流进行对齐,以在处理前同步输入信号。
  • 应用盲波束成形技术,利用空间协方差矩阵提升语音质量,实现在不同麦克风间对相干信号的有效组合。
  • 采用留一法波束成形生成多个波束成形信号,增强系统鲁棒性,并支持有效的系统融合。
  • 对所有波束成形信号联合执行自动语音识别(ASR),生成包含词级时间戳的n-best假设。
  • 在ASR之后使用说话人嵌入和词级时间标记执行说话人分割,为转录段落分配说话人标签。
  • 实施基于增量式ROVER的系统融合,实时融合词假设与说话人标签,最大限度降低延迟。

实验结果

研究问题

  • RQ1在异步多麦克风会议转录中,结合留一法波束成形的系统融合在提升词错误率与说话人归属准确性方面有何效果?
  • RQ2在使用波束成形与系统融合的情况下,增加麦克风数量对WER与SAWER的影响如何,特别是在不同数量下?
  • RQ3盲波束成形与声学模型融合在远距离语音识别中,能在多大程度上降低词错误率与分割错误率?
  • RQ4该系统如何在保持高精度的同时实现低延迟的实时说话人归属转录?
  • RQ5在非重叠语音段上,异步分布式麦克风与近讲麦克风之间的性能差距有多大?

主要发现

  • 在七路输入麦克风条件下,系统实现了22.3%的词错误率(WER),在非重叠语音上仅比近讲麦克风性能低3.0个百分点绝对误差。
  • 说话人归属词错误率(SAWER)为26.7%,相较于单设备系统,分别在三、五、七麦克风条件下实现了14.8%、20.3%和22.4%的相对改进。
  • 结合留一法波束成形与系统融合后,WER相比仅使用CNC(Cascaded N-best)降低了5.8%相对误差,优于标准波束成形与单设备基线。
  • 在NIST RT-07测试集上,系统实现了13.6%的分割错误率(DER),其中10%的语音时长存在重叠语音,这导致了大多数漏检段落。
  • 波束成形显著提升了系统融合性能,通过均衡输入信号质量,尤其在麦克风录音质量差异较大的情况下效果更明显。
  • 通过增量式ROVER处理与后ASR分割,系统实现了低延迟运行,支持实时说话人归属转录。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。