Skip to main content
QUICK REVIEW

[论文解读] Advances in Online Audio-Visual Meeting Transcription

Takuya Yoshioka, Igor Abramovski|arXiv (Cornell University)|Dec 10, 2019
Speech and Audio Processing参考文献 54被引用 17
一句话总结

本文提出了一种基于新型连续语音分离(CSS)方法和名为SRD('分离、识别、聚类')的音视频聚类框架的在线音视频会议转录系统。通过实时应用CSS分离重叠语音,并结合面部追踪、声源定位和说话人识别,该系统相较于波束成形技术将词错误率(WER)降低了16.1%,在所有与会者均已知的情况下实现了近乎完美的说话人归属,WER与说话人归属WER之间的差异仅为1.0%。

ABSTRACT

This paper describes a system that generates speaker-annotated transcripts of meetings by using a microphone array and a 360-degree camera. The hallmark of the system is its ability to handle overlapped speech, which has been an unsolved problem in realistic settings for over a decade. We show that this problem can be addressed by using a continuous speech separation approach. In addition, we describe an online audio-visual speaker diarization method that leverages face tracking and identification, sound source localization, speaker identification, and, if available, prior speaker information for robustness to various real world challenges. All components are integrated in a meeting transcription framework called SRD, which stands for "separate, recognize, and diarize". Experimental results using recordings of natural meetings involving up to 11 attendees are reported. The continuous speech separation improves a word error rate (WER) by 16.1% compared with a highly tuned beamformer. When a complete list of meeting attendees is available, the discrepancy between WER and speaker-attributed WER is only 1.0%, indicating accurate word-to-speaker association. This increases marginally to 1.6% when 50% of the attendees are unknown to the system.

研究动机与目标

  • 为解决在自然会议环境中长期存在的重叠语音识别挑战,此前的方法难以泛化至连续的、真实世界的对话音频。
  • 开发一种鲁棒的、实时的音视频说话人聚类系统,整合面部追踪、声源定位和说话人识别,以实现精确的说话人归属。
  • 设计一个模块化、可扩展的框架(SRD),支持多种应用场景,包括仅音频、音视频以及存在未知与会者的情况。
  • 展示连续语音分离(CSS)在端到端会议转录中的有效性,特别是在提升重叠语音段识别准确率方面的优势。

提出的方法

  • 该系统采用一种连续语音分离(CSS)模块,从多通道音频中生成N个时间同步的输出信号,其中N为预期的最大同时说话人数;当活跃说话人少于该数量时,输出为零。
  • SRD框架以流水线方式处理音频和视频输入:首先通过CSS分离重叠语音,然后利用深度神经网络声学模型和语言模型进行语音识别,最后结合音视频线索完成说话人聚类。
  • 音视频聚类结合了面部追踪、面部识别、声源定位(SSL)和说话人识别,其中CSS生成的时频掩码用于优化说话人归属。
  • 系统使用7元环形麦克风阵列和鱼眼摄像头采集音频和视频,实现延迟仅几秒的实时处理。
  • 说话人聚类在语音识别之后进行,从而可根据对与会者先验知识的有无,灵活集成不同的聚类模块。
  • 通过使用会议期间捕获的面部快照来增强对访客说话人的识别,相比预注册图像在不同条件下更具鲁棒性。

实验结果

研究问题

  • RQ1连续语音分离(CSS)是否能有效提升处理自然重叠语音的实时会议转录系统的词错误率(WER)?
  • RQ2在真实会议环境中,整合面部追踪、声源定位和说话人识别等音视频线索,如何提升说话人聚类的准确性?
  • RQ3对与会者事前知识的有无对说话人归属准确率有何影响?系统如何处理未知或访客说话人?
  • RQ4所提出的SRD框架在多样化部署场景(包括仅音频和混合身份设置)中的适用程度如何?

主要发现

  • 连续语音分离(CSS)方法相较于高度优化的波束成形技术,将词错误率(WER)相对降低了16.1%,在重叠语音段上表现出显著改进。
  • 当所有与会者均已知时,WER与说话人归属WER(SA-WER)之间的差异仅为1.0%,表明词与说话人之间的关联极为准确。
  • 当50%的与会者未知(视为访客)时,SA-WER仅轻微上升至1.6%,表明系统对部分先验知识具有鲁棒性。
  • 在50%与会者未知的情况下,仅使用面部识别和SSL的性能更差,这是由于图像条件不匹配所致,凸显了说话人识别的优势。
  • 在包含近似视觉处理的扩展测试集上,系统保持了稳定的WER(20.1%)和SA-WER(22.1%),证实了其在实时处理中的鲁棒性与可扩展性。
  • 所提出的SRD框架成功集成了CSS、语音识别与聚类,首次在完整会议转录流程中实现了端到端的CSS演示。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。