[论文解读] Detection of Audio-Video Synchronization Errors Via Event Detection
本文提出一种两阶段深度学习方法,用于检测网球视频中的音视频同步错误,通过检测球击打事件的音频和视觉特征。基于包含504,300帧的大规模数据集,该方法在检测微小A/V同步误差时达到81.25%的精确率和83.87%的召回率,优于以往端到端方法在细粒度偏移量上的表现。
We present a new method and a large-scale database to detect audio-video synchronization(A/V sync) errors in tennis videos. A deep network is trained to detect the visual signature of the tennis ball being hit by the racquet in the video stream. Another deep network is trained to detect the auditory signature of the same event in the audio stream. During evaluation, the audio stream is searched by the audio network for the audio event of the ball being hit. If the event is found in audio, the neighboring interval in video is searched for the corresponding visual signature. If the event is not found in the video stream but is found in the audio stream, A/V sync error is flagged. We developed a large-scaled database of 504,300 frames from 6 hours of videos of tennis events, simulated A/V sync errors, and found our method achieves high accuracy on the task.
研究动机与目标
- 为解决在视频流中检测微小音视频同步错误的挑战,特别是低于人类感知阈值的错误。
- 克服端到端模型在亚秒级偏移量下失效且缺乏可解释性的局限。
- 开发一种可扩展、可解释的方法,用于视频点播和直播服务中的自动化A/V同步错误检测。
- 构建一个大规模、帧级精确的网球事件数据集,标注内容包括击球、球落地及非比赛状态。
提出的方法
- 训练一个深度音频事件检测器(AED),通过以视频帧为中心的160ms音频片段,识别网球击打的听觉特征。
- 训练一个深度视频事件检测器(VED),通过输入三帧图像组(80ms)检测球击打的视觉特征,标签来源于帧级标注。
- 推理阶段,AED扫描音频流以识别击打事件;若检测到击打,则VED检查该音频事件前后最多240ms内的视频帧,寻找对应的视觉事件。
- 若在音频击打事件的时间邻域内未检测到对应视觉事件,则标记为A/V同步错误。
- 系统采用邻域搜索策略,以纠正事件检测中的时间错位,提升对微小时间误差的鲁棒性。
- 通过随机将视频与音频片段偏移±15帧(排除−3至+6帧)的方式,对音视频同步错误进行合成模拟,以评估错误检测性能。
实验结果
研究问题
- RQ1两阶段事件检测方法是否能在小偏移量下实现比端到端模型更高的检测准确率?
- RQ2结合时间邻域分析的音频与视频事件检测,在识别A/V同步错误方面是否具有高效率?
- RQ3大规模、帧级标注的网球视频数据集是否能实现高精度的A/V同步错误检测?
- RQ4当音频与视频事件时间错位小于100ms时,该方法的鲁棒性如何?
主要发现
- 经过对相邻误报与漏报的校正后,音频事件检测器的精确率达到90.2%,召回率达到72.76%;这些误报与漏报由VED的邻域搜索策略予以修正。
- 通过早停策略,视频事件检测器实现了高召回率,确保极少遗漏击打事件,这对避免误报同步错误至关重要。
- 最终的A/V同步错误检测系统在模拟同步错误上实现了81.25%的精确率和83.87%的召回率,优于以往方法在小偏移量下的表现。
- 该方法可成功检测幅度低于50ms的A/V同步错误,此类错误通常对人类不可感知,但严重影响视频质量。
- 基于6小时网球视频的504,300帧大规模数据集,包含2,443个标注击打事件,为系统的稳健训练与评估提供了支持。
- 当音频事件持续时间跨越多个片段时,系统性能依然稳健,因为VED会检查邻近帧以消除歧义。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。