Skip to main content
QUICK REVIEW

[论文解读] AVA-Speech: A Densely Labeled Dataset of Speech Activity in Movies

Sourish Chaudhuri, Joseph Roth|arXiv (Cornell University)|Aug 2, 2018
Speech and Audio Processing参考文献 28被引用 4
一句话总结

本论文介绍了 AVA-Speech,这是一个公开发布的、密集标注的语音活动数据集,涵盖190部电影,总计约46小时,包含对纯净语音、带音乐语音和带噪声语音的帧级标注。该研究评估了当前最先进的音频与视觉模型,结果表明音频模型在噪声环境下性能下降,而视觉语音分类(VSC)性能保持稳定,为未来在音视频语音检测领域的研究建立了基准。

ABSTRACT

Speech activity detection (or endpointing) is an important processing step for applications such as speech recognition, language identification and speaker diarization. Both audio- and vision-based approaches have been used for this task in various settings, often tailored toward end applications. However, much of the prior work reports results in synthetic settings, on task-specific datasets, or on datasets that are not openly available. This makes it difficult to compare approaches and understand their strengths and weaknesses. In this paper, we describe a new dataset which we will release publicly containing densely labeled speech activity in YouTube videos, with the goal of creating a shared, available dataset for this task. The labels in the dataset annotate three different speech activity conditions: clean speech, speech co-occurring with music, and speech co-occurring with noise, which enable analysis of model performance in more challenging conditions based on the presence of overlapping noise. We report benchmark performance numbers on AVA-Speech using off-the-shelf, state-of-the-art audio and vision models that serve as a baseline to facilitate future research.

研究动机与目标

  • 为解决真实世界、多样化媒体环境中语音活动检测(VAD)缺乏标准且公开可用的基准数据集的问题。
  • 构建一个大规模、时间上密集的数据集,包含视频与音频标注,以支持对仅音频和音视频VAD模型的评估。
  • 明确标注三种具有挑战性的条件下的语音活动:纯净语音、带音乐语音和带噪声语音,以支持对模型鲁棒性的分析。
  • 使用现成的最先进音频与视觉模型提供基线性能结果,以供未来比较。
  • 建立一个共享基准,支持未来在联合音视频建模及相关任务上的研究。

提出的方法

  • 该数据集由185段电影片段(每段15分钟)构建而成,来源为YouTube,总计约46小时视频,所选片段旨在代表多样的说话情境。
  • 人工标注员对语音活动进行了密集的帧级标注,根据预定义说明将每一帧分类为:NoSpeech、CleanSpeech、SpeechWithMusic 或 SpeechWithNoise。
  • 音频模型的评估基于WebRTC VAD、一个小型CNN(tiny_320)以及一个基于ResNet-50的更大模型(resnet_960),输入为10ms的梅尔频谱图。
  • 视觉语音分类(VSC)通过检测并跟踪人脸,然后对连续3帧的人脸缩略图应用轻量级CNN来预测语音活动。
  • 所有条件下均在固定误报率(FPR = 0.315)下评估模型性能,报告各条件及总体的真正例率(TPR)。
  • 通过调整分类阈值生成ROC曲线,以评估不同工作点的性能,延迟测量在单线程CPU上进行。

实验结果

研究问题

  • RQ1在具有不同背景噪声条件的真实世界、多样化电影数据集上,当前最先进的音频与视觉语音检测模型表现如何?
  • RQ2背景噪声(如音乐或环境噪声)在多大程度上会降低仅音频语音活动检测模型的性能?
  • RQ3当音频模型在噪声环境下失效时,视觉语音分类模型是否能在不同噪声条件下保持一致的性能?
  • RQ4在固定误报率下评估音频与视觉模型的性能,该条件反映真实部署中的约束,两者表现如何比较?
  • RQ5这些模型的推理延迟是多少,其对实时系统实际部署的影响如何?

主要发现

  • WebRTC VAD在纯净语音上的真正例率(TPR)为0.786,但在带噪声语音上下降至0.706,总体TPR为0.733,表明对背景噪声敏感。
  • tiny_320音频模型在纯净语音上的TPR为0.965,带音乐语音为0.826,带噪声语音为0.623,表明在噪声环境下性能显著下降。
  • 更大的resnet_960模型在纯净语音上的TPR最高,达0.992,在带音乐语音上为0.944,但在带噪声语音上仅为0.787,证实音频模型在噪声下性能下降。
  • 视觉语音分类(VSC)模型在纯净语音上的TPR为0.588,带音乐语音为0.568,带噪声语音为0.556,在各种条件下保持相对稳定。
  • 尽管绝对性能较低,VSC在不同噪声类型下表现一致,表明其在复杂声学环境中的鲁棒性。
  • VSC模型的延迟为40.0 ms,显著高于音频模型(0.06–2.23 ms),主要由于人脸检测与跟踪的开销。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。