[论文解读] Themes Informed Audio-visual Correspondence Learning
本文提出了一种主题感知的音视频对应学习(Ti-AVC)框架,通过利用视频标签整合主题信息,提升了在短用户生成视频中的对应学习性能。通过联合建模主题预测与音视频匹配,该方法在新发布的85,432段短视频广告数据集KWAI-AD-AudVis上,相较当前最先进基线方法实现了23.15%的AUC绝对提升。
The applications of short-term user-generated video (UGV), such as Snapchat, and Youtube short-term videos, booms recently, raising lots of multimodal machine learning tasks. Among them, learning the correspondence between audio and visual information from videos is a challenging one. Most previous work of the audio-visual correspondence(AVC) learning only investigated constrained videos or simple settings, which may not fit the application of UGV. In this paper, we proposed new principles for AVC and introduced a new framework to set sight of videos' themes to facilitate AVC learning. We also released the KWAI-AD-AudVis corpus which contained 85432 short advertisement videos (around 913 hours) made by users. We evaluated our proposed approach on this corpus, and it was able to outperform the baseline by 23.15% absolute difference.
研究动机与目标
- 为解决现有音视频对应(AVC)方法在非约束性、短时用户生成视频(UGVs)中的局限性。
- 提出新的AVC原则,考虑语义主题与模态关系,而不仅依赖简单相似性。
- 开发一种灵活的框架,通过视频标签作为间接主题监督,将主题信息注入AVC学习过程。
- 收集并发布KWAI-AD-AudVis数据集,这是首个大规模、按内容分组的短视频广告音视频数据集。
- 证明主题感知学习在复杂、真实世界UGV场景中能显著提升AVC性能。
提出的方法
- 提出双流框架:主题学习(TL)分支用于从模态嵌入中预测视频主题,对应学习(CL)分支用于匹配音频与视觉输入。
- 利用视频标签作为主题表征的间接监督,使模型能够学习主题在不同模态间的表达方式。
- 采用联合训练策略,其中CL分支同时依赖模态嵌入与预测/真实主题标签。
- 使用第一层权重的绝对值进行加权贡献分析,以量化输入模态的重要性(公式1)。
- 引入灵活的推理设置,其中TL模型可固定,主题标签可来自任一模态。
- 采用类似Siamese的结构与对比损失,在主题感知监督下学习判别性音视频嵌入。
实验结果
研究问题
- RQ1在非约束性、短时用户生成视频中,整合主题信息是否能提升音视频对应学习性能?
- RQ2所提出的主题感知框架与忽略语义主题的基线方法相比表现如何?
- RQ3主题信息在多大程度上提升了模型区分正确音视频配对的能力?
- RQ4当推理阶段缺乏主题信息时,该框架是否仍能保持性能?
- RQ5不同模态(音频、视觉、预测/真实主题)对最终对应决策的贡献如何?
主要发现
- 所提出的Ti-AVC框架在KWAI-AD-AudVis数据集上相较最先进基线方法实现了23.15%的AUC绝对提升(78.73% vs. 55.58%)。
- 将主题作为输入的基线方法(Baseline-2)相比无主题基线性能提升18.94%,验证了主题监督的重要性。
- 即使在推理阶段无真实主题信息,Ti-AVC在19个主题类别中的15个上仍优于基线,表现出强鲁棒性。
- 音频模态对最终预测的贡献最大(58.78%),其次为视觉模态(30.85%)、真实主题(5.86%)和预测主题(4.52%)。
- 贡献分析证实主题信号与模态信号均不可或缺,支持了所提出的主题一致性与模态关系原则。
- 框架的灵活性通过固定TL模型并从任一模态获取主题标签得到验证,支持真实场景部署。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。