Skip to main content
QUICK REVIEW

[论文解读] Co-Training of Audio and Video Representations from Self-Supervised Temporal Synchronization

Bruno Korbar, Du Tran|arXiv (Cornell University)|Jun 30, 2018
Music and Audio Processing参考文献 27被引用 52
一句话总结

该论文提出了一种自监督方法,通过训练模型识别音视频流之间的时序同步性,来学习强大的音频和视频表征。采用对比学习结合课程学习策略以及精心设计的负样本采样方法,该方法在音频基准测试中达到最先进性能,并在微调自监督预训练模型时,使UCF101上的动作识别准确率提升+16.7%,HMDB51上的准确率提升+13.0%。

ABSTRACT

There is a natural correlation between the visual and auditive elements of a video. In this work we leverage this connection to learn general and effective features for both audio and video analysis from self-supervised temporal synchronization. We demonstrate that a calibrated curriculum learning scheme, a careful choice of negative examples, and the use of a contrastive loss are critical ingredients to obtain powerful multi-sensory representations from models optimized to discern temporal synchronization of audio-video pairs. Without further finetuning, the resulting audio features achieve performance superior or comparable to the state-of-the-art on established audio classification benchmarks (DCASE2014 and ESC-50). At the same time, our visual subnet provides a very effective initialization to improve the accuracy of video-based action recognition models: compared to learning from scratch, our self-supervised pretraining yields a remarkable gain of +16.7% in action recognition accuracy on UCF101 and a boost of +13.0% on HMDB51.

研究动机与目标

  • 利用音视频信号之间的自然相关性学习通用的音频和视频表征。
  • 解决在无人工标注数据情况下学习鲁棒多模态特征的挑战。
  • 通过自监督预训练提升下游音频和视频识别任务的性能。
  • 探究音视频时序对齐是否可作为表征学习的强监督信号。

提出的方法

  • 该方法使用对比损失,训练模型区分正样本(同步)和负样本(异步)的音视频对。
  • 采用校准的课程学习方案,逐步增加训练过程中负样本的难度。
  • 精心选择负样本,确保其语义相关但时序错位,从而增强特征的判别能力。
  • 模型联合优化音频和视频编码器,共享一个投影头用于对比学习。
  • 将时序同步作为自监督信号,避免了人工标注的需求。
  • 该方法实现了仅使用原始音视频输入的端到端音视频编码器训练。

实验结果

研究问题

  • RQ1音视频之间的时序同步能否作为学习通用表征的有效自监督信号?
  • RQ2课程学习如何影响自监督音视频表征的质量?
  • RQ3负样本采样策略对音视频表征学习中对比学习性能有何影响?
  • RQ4自监督预训练在多大程度上能提升下游动作识别与音频分类的准确率?
  • RQ5所学习的音频和视频特征在标准基准上与最先进方法相比如何?

主要发现

  • 自监督学习得到的音频特征在DCASE2014和ESC-50音频分类基准上表现优于或相当于最先进方法。
  • 通过自监督预训练学习的视觉特征使UCF101上的动作识别准确率相比从零开始训练提升了+16.7%。
  • 在HMDB51上,使用预训练视觉特征进行微调时,准确率提升了+13.0%。
  • 对比损失、课程学习与精心设计的负样本采样策略的结合对实现优异性能至关重要。
  • 该方法泛化能力强,无需任何任务特定微调即可实现强大的零样本迁移性能。
  • 结果表明,时序对齐是视频中多模态表征学习的强大信号。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。