Skip to main content
QUICK REVIEW

[论文解读] Who said that?: Audio-visual speaker diarisation of real-world meetings

Joon Son Chung, Bong‐Jin Lee|arXiv (Cornell University)|Jun 24, 2019
Speech and Audio Processing参考文献 34被引用 5
一句话总结

该论文提出了一种音视频说话人分割系统,利用深度音视频同步技术从视频和音频中自动注册说话人模型,将无监督聚类转化为有监督分类。通过利用视觉线索检测说话段并注册说话人嵌入,该方法在AMI会议语料库上实现了最先进性能,相较于仅使用音频的基线模型,说话人错误率相对降低了48%(ES)和26%(IS),且通过波束成形和多模态融合进一步提升了性能。

ABSTRACT

The goal of this work is to determine 'who spoke when' in real-world meetings. The method takes surround-view video and single or multi-channel audio as inputs, and generates robust diarisation outputs. To achieve this, we propose a novel iterative approach that first enrolls speaker models using audio-visual correspondence, then uses the enrolled models together with the visual information to determine the active speaker. We show strong quantitative and qualitative performance on a dataset of real-world meetings. The method is also evaluated on the public AMI meeting corpus, on which we demonstrate results that exceed all comparable methods. We also show that beamforming can be used together with the video to further improve the performance when multi-channel audio is available.

研究动机与目标

  • 解决在真实会议场景中高精度确定'谁在何时说话'的挑战。
  • 克服传统仅音频分割方法的局限性,后者将问题视为无监督聚类,难以处理语音重叠和未知说话人。
  • 通过整合视觉信息实现说话人模型注册,提升对说话人移动和遮挡的鲁棒性。
  • 通过音频与视频的多模态融合,展示性能提升,尤其在真实世界、非受限的会议环境中。
  • 评估多通道音频下波束成形和空间音频线索的影响。

提出的方法

  • 使用深度音视频同步网络检测视频中口部动作明显可见时的说话段,实现说话人模型的自注册。
  • 从音频段中提取说话人嵌入(x-向量),仅在视觉确认说话时触发模型注册。
  • 通过已注册的说话人模型为每个段落分配概率,将分割从无监督聚类重新定义为有监督分类。
  • 对多通道音频应用波束成形以估计声源位置,并将该信息与视觉线索融合,提升活跃说话人检测性能。
  • 在推理阶段采用概率融合框架,结合音频、视觉和空间线索,自适应加权通过验证数据调优。
  • 基于JHU Sys4的VAD和分割流水线,采用PLDA打分和AHC聚类,但将聚类替换为基于模型的分类。
Figure 1: Pipeline overview.
Figure 1: Pipeline overview.

实验结果

研究问题

  • RQ1能否利用音视频对应关系在无先验说话人信息的情况下可靠地自注册说话人模型?
  • RQ2使用自注册模型将分割从聚类转化为分类,是否能提升真实会议场景下的性能?
  • RQ3视觉语音检测和波束成形在应对遮挡和背景噪声方面分别起到何种作用?
  • RQ4与单模态或早期融合基线相比,音频、视频和空间线索的多模态融合在多大程度上降低了说话人错误率?
  • RQ5所提方法在说话人数和移动情况多变的非受限真实会议环境中是否具备良好的泛化能力?

主要发现

  • 所提音视频说话人分割系统在AMI语料库的ES子集上,相较于仅音频基线,说话人错误率(SPKE)相对降低了48%。
  • 在IS子集上,系统实现了26%的SPKE相对降低,表明其在多样化会议条件下的强大泛化能力。
  • 添加音视频对应(AVC)和声源定位(SSL)分别带来了20–40%和19–39%的相对性能增益,具体取决于测试集。
  • 该系统在AMI语料库的所有测试条件下均优于先前的最先进音视频方法,包括[cabanas2018multimodal]。
  • 该方法在内部真实会议数据集上也表现出良好泛化能力,而仅音频基线在此数据集上失效,表明其对复杂、非受限环境的鲁棒性。
  • 多通道音频的波束成形进一步提升了性能,尤其在结合视觉信息时,显著增强了空间线索的利用。
Figure 2: Still image from the internal meeting dataset.
Figure 2: Still image from the internal meeting dataset.

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。