Skip to main content
QUICK REVIEW

[论文解读] Intel Labs at Ego4D Challenge 2022: A Better Baseline for Audio-Visual Diarization

Kyle Min|arXiv (Cornell University)|Oct 14, 2022
Speech and Audio Processing被引用 4
一句话总结

该论文通过改进用于光谱图的ResNet-18的训练方案,提升了相机佩戴者(CW)语音活动检测性能,采用现成的VAD模型(Silero)作为后处理模块以减少CW语音中的误报,并利用最先进的ASD模型(SPELL)实现更优的活跃说话人检测,从而为自拍视频中的音视频分割提供了更优基线。该方法在Ego4D测试集上实现了65.9%的分割错误率(DER),显著优于基线模型,并在2022年挑战赛中获得第一名。

ABSTRACT

This report describes our approach for the Audio-Visual Diarization (AVD) task of the Ego4D Challenge 2022. Specifically, we present multiple technical improvements over the official baselines. First, we improve the detection performance of the camera wearer's voice activity by modifying the training scheme of its model. Second, we discover that an off-the-shelf voice activity detection model can effectively remove false positives when it is applied solely to the camera wearer's voice activities. Lastly, we show that better active speaker detection leads to a better AVD outcome. Our final method obtains 65.9% DER on the test set of Ego4D, which significantly outperforms all the baselines. Our submission achieved 1st place in the Ego4D Challenge 2022.

研究动机与目标

  • 解决自拍视频中相机佩戴者通常不可见所带来的挑战,需依赖鲁棒的纯音频检测方法来识别其语音活动。
  • 通过修改基于音频的VAD模型的训练方案,提升相机佩戴者语音活动检测性能,使其mAP从72.0%提升至80.4%。
  • 探究将现成的VAD模型用作后处理模块是否能提升分割性能,特别是过滤相机佩戴者语音中的误报。
  • 证明改进的活跃说话人检测(ASD)可直接带来更优的整体AVD性能,这一关系在官方Ego4D基线中尚未得到验证。
  • 在Ego4D 2022年AVD挑战赛中实现最先进性能,最终以65.9%的DER在测试集上获得第一名。

提出的方法

  • 在5ms音频帧的对数频谱图(0–4000 Hz)上训练2D ResNet-18模型,采用0.32s的时间窗口,通过改进的训练方案检测相机佩戴者的语音活动,使mAP从72.0%提升至80.4%。
  • 将现成的VAD模型(Silero,版本3.1)作为后处理模块,仅应用于相机佩戴者预测的语音段,有效减少误报,并使最终分割性能提升超过4%。
  • 主动说话人检测(ASD)组件采用最先进的SPELL模型,与以往基线相比,显著提升了ASD的mAP和下游AVD性能。
  • 该框架整合了人脸检测、音视频语音分割和音频嵌入分析,利用相机佩戴者的VAD输出及后处理结果优化说话人轮换边界。
  • 仅对相机佩戴者的输出应用Silero VAD后处理,因为其在其他说话人检测上效果差或有害,尤其在信噪比较低时。
  • 整个训练流程在单张TITAN V GPU上运行时间不足一小时,使用Adam优化器,固定学习率为5×10⁻⁴,Dropout率为0.5。

实验结果

研究问题

  • RQ1对光谱图上的ResNet-18模型采用改进的训练方案,是否能显著提升自拍视频中相机佩戴者语音活动检测的性能?
  • RQ2将现成的VAD模型作为后处理模块应用于相机佩戴者语音输出,是否能减少误报并提升整体AVD性能?
  • RQ3在Ego4D数据集上,改进的主动说话人检测(ASD)性能与更优的音视频分割结果之间是否存在直接且可测量的相关性?
  • RQ4为何使用现成的VAD模型后处理仅对相机佩戴者输出有效,而对其他说话人的检测无效?
  • RQ5相较于以往基线,采用更优的ASD模型(如SPELL)是否能显著提升AVD性能?

主要发现

  • 相机佩戴者VAD模型经改进训练方案后,在验证集上的mAP从72.0%提升至80.4%,显著增强了检测可靠性。
  • 将Silero VAD模型作为后处理模块应用于相机佩戴者语音输出,使分割错误率(DER)降低超过4%,在验证集上达到66.6%的DER。
  • 采用SPELL模型进行主动说话人检测,在验证集上实现60.7%的mAP@0.5和66.6%的DER,显著优于以往基线。
  • 最终方法在Ego4D测试集上实现65.9%的DER,相比使用TalkNet的基线方法提升7.4个百分点,成功获得挑战赛第一名。
  • 实证结果证实,更优的ASD性能可直接带来更优的AVD结果,这一关系在官方Ego4D基线中未被验证。
  • 仅当应用于相机佩戴者输出时,现成VAD模型的后处理才带来性能提升,因其在缺乏视觉线索的远距离或低能量说话人上效果较差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。