[论文解读] Leveraging Random Label Memorization for Unsupervised Pre-Training
本文提出了一种新颖的无监督预训练方法,通过在深度神经网络中利用随机标签记忆机制,从大规模未标注数据集中学习有用的表征。通过在随机标注的视频数据(如 UCF101、Kinetics)上预训练 3D-CNN,模型构建了一个通用的记忆化基础设施,使在多个基准测试上的下游动作识别准确率提升了 1.5% 至 5%。
We present a novel approach to leverage large unlabeled datasets by pre-training state-of-the-art deep neural networks on randomly-labeled datasets. Specifically, we train the neural networks to memorize arbitrary labels for all the samples in a dataset and use these pre-trained networks as a starting point for regular supervised learning. Our assumption is that the "memorization infrastructure" learned by the network during the random-label training proves to be beneficial for the conventional supervised learning as well. We test the effectiveness of our pre-training on several video action recognition datasets (HMDB51, UCF101, Kinetics) by comparing the results of the same network with and without the random label pre-training. Our approach yields an improvement - ranging from 1.5% on UCF-101 to 5% on Kinetics - in classification accuracy, which calls for further research in this direction.
研究动机与目标
- 通过利用大规模未标注数据集,解决视频动作识别中标签数据成本高且稀缺的问题。
- 探究记忆随机标签是否能为下游监督学习产生有用的表征。
- 探索一种替代基于重建的无监督预训练方法,避免预训练与微调阶段之间的特征分布不匹配问题。
- 证明随机标签预训练可提升泛化能力并加速监督微调的收敛速度。
- 提供实证证据表明,记忆能力形成了一种可重用的基础设施,对后续学习任务有益。
提出的方法
- 在大规模未标注视频数据集(如 UCF101、Sports-1M)上,使用随机分配的标签对 3D-CNN(C3D)进行预训练,以强制记忆任意标签分配。
- 将所得的预训练模型作为微调的起点,在相同数据集上使用正确标签进行微调,实现在预训练阶段无需监督的迁移学习。
- 在互补数据集上进行交叉预训练(例如,在 UCF101 的随机标签上预训练以提升 HMDB51 的性能),以验证可迁移性。
- 通过仅使用 Sports-1M 数据集的 40% 用于随机标签预训练,评估预训练规模的影响。
- 测量初始预训练后后续记忆化过程的速度,以验证可重用记忆化基础设施的存在。
- 与随机初始化和相同数据上的监督预训练进行对比,以隔离随机标签预训练带来的实际收益。
实验结果
研究问题
- RQ1在随机标注数据上预训练深度神经网络是否能提升下游视频动作识别任务的性能?
- RQ2在网络进行随机标签训练期间,是否发展出一种可泛化的记忆化基础设施,从而有利于后续的监督学习?
- RQ3使用未标注数据集进行预训练的规模增大时,随机标签预训练带来的性能增益如何变化?
- RQ4性能提升是源于学习到的特征,还是仅仅因为更好的初始化带来的更快收敛?
- RQ5在哪个网络深度或层类型上,记忆化基础设施最有效地形成?
主要发现
- 与随机初始化相比,随机标签预训练在 UCF101 上将分类准确率提升了 1.7%,在 HMDB51 上提升了 0.8%。
- 在 Kinetics 数据集上,使用 Sports-1M 数据集 40% 的子集进行随机标签预训练,准确率达到 40.2%,相比无预训练基线的 35.0% 减少了 8% 的相对误差。
- 与基线相比,随机标签预训练带来的性能增益显著——在 Kinetics 上最高可达 5% 的提升,尽管仍低于使用完整 Sports-1M 数据集进行监督预训练所达到的 69.8% 准确率。
- 在初始随机标签预训练后,后续的记忆化任务收敛速度明显快于首次,表明可重用记忆化基础设施的存在。
- 该性能提升在多个数据集上保持一致,表明所学基础设施在不同视频动作识别任务中具有泛化能力。
- 结果表明,即使标签与输入数据无关,对任意标签的记忆化也能诱导出对下游分类有益的特征学习。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。