Skip to main content
QUICK REVIEW

[论文解读] Evolving Losses for Unlabeled Video Representation Learning

AJ Piergiovanni, Anelia Angelova|arXiv (Cornell University)|Jun 7, 2019
Human Pose and Action Recognition参考文献 9被引用 4
一句话总结

该论文提出一种进化算法,用于自动发现多模态、多任务自监督视频表征学习中的最优损失加权,将音频、光流和时序特征蒸馏到单一基于RGB的网络中。该方法在仅使用未标注视频数据的情况下,优于ImageNet预训练和监督微调Kinetics,HMDB51上达到66.2%的准确率,UCF101上达到92.4%。

ABSTRACT

We present a new method to learn video representations from unlabeled data. Given large-scale unlabeled video data, the objective is to benefit from such data by learning a generic and transferable representation space that can be directly used for a new task such as zero/few-shot learning. We formulate our unsupervised representation learning as a multi-modal, multi-task learning problem, where the representations are also shared across different modalities via distillation. Further, we also introduce the concept of finding a better loss function to train such multi-task multi-modal representation space using an evolutionary algorithm; our method automatically searches over different combinations of loss functions capturing multiple (self-supervised) tasks and modalities. Our formulation allows for the distillation of audio, optical flow and temporal information into a single, RGB-based convolutional neural network. We also compare the effects of using additional unlabeled video data and evaluate our representation learning on standard public video datasets.

研究动机与目标

  • 通过自动发现最优损失函数权重而非人工调参,改进无监督视频表征学习。
  • 通过蒸馏将知识迁移至单一RGB网络,实现在RGB、音频、光流和灰度特征之间的多模态、多任务学习。
  • 在不进行任何监督预训练的前提下,评估大规模未标注视频数据对下游识别性能的影响。
  • 证明进化损失函数相比随机或手工设计的损失组合具有更好的泛化能力。
  • 通过进化后的损失权重分析哪些任务和模态对动作识别最具益处。

提出的方法

  • 将无监督视频表征学习建模为多模态、多任务学习问题,通过蒸馏实现模态间共享表征。
  • 使用任务特定损失 $\mathcal{L}_{m,t}$ 和蒸馏损失 $\mathcal{L}_d$ 的加权和构成总损失:$\mathcal{L} = \sum_{m}\sum_{t}\lambda_{m,t}\mathcal{L}_{m,t} + \sum_{d}\lambda_d\mathcal{L}_d$,其中 $\lambda_{m,t}, \lambda_d \in [0,1]$。
  • 采用进化算法在损失权重空间中进行搜索,维护一组权重配置群体,并根据HMDB子集上的聚类性能选择适应度最高的个体。
  • 将蒸馏损失定义为在对应层上主RGB网络与其它模态(如音频、光流)激活值之间的 $L_2$ 差异。
  • 初始种群使用 $[0,1]$ 范围内的随机权重初始化,通过每次变异一个权重并选择性能最佳的配置,迭代优化。
  • 在使用少量标注数据微调后,对标准视频基准(HMDB51、UCF101)评估最终模型性能。

实验结果

研究问题

  • RQ1进化算法能否有效发现多任务、多模态自监督视频表征学习中的最优损失权重?
  • RQ2与手工设计或随机损失函数相比,进化损失在下游动作识别准确率上的表现如何?
  • RQ3哪些自监督任务和模态(如音频、光流、RGB)对学习有效视频表征贡献最大?
  • RQ4在不进行任何监督预训练的前提下,仅使用未标注视频数据,其性能在多大程度上可与ImageNet或Kinetics预训练相媲美?
  • RQ5蒸馏损失的时间和层位置如何影响表征质量?进化后的损失结构中是否存在可识别的模式?

主要发现

  • 在仅使用10%的Kinetics标注数据微调后,进化损失函数在HMDB51上达到66.2%的准确率,在UCF101上达到92.4%,优于ImageNet预训练和监督微调Kinetics基线。
  • 仅使用25,000个标注样本(Kinetics的10%),模型准确率达到58.1%,仅比完整监督基线低11%,展现出强大的数据效率。
  • 进化损失为音频-视频对齐、未来帧预测以及RGB到光流重建等任务分配了高权重,而为帧乱序和色彩化任务分配了低权重。
  • 对于与RGB更相似的灰度特征,蒸馏更早应用;而对于音频和光流特征,蒸馏则更晚应用,表明模态特定的最优融合时机。
  • 进化过程表明,跨模态重建与对齐任务比帧序预测或色彩化任务对动作识别更具益处。
  • 增加未标注数据量可持续提升性能,当训练时间固定时,使用更多数据可获得更大收益,表明方法具有良好的可扩展性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。