[论文解读] VideoSSL: Semi-Supervised Learning for Video Classification
该论文提出 VideoSSL,一种用于视频分类的半监督学习方法,利用未标记视频片段的伪标签以及来自预训练2D图像分类器的外观正则化。通过结合这两种监督信号,该方法仅使用10%–20%的标注数据,就在UCF101、HMDB51和Kinetics数据集上实现了最先进性能,优于完全监督训练的结果。
We propose a semi-supervised learning approach for video classification, VideoSSL, using convolutional neural networks (CNN). Like other computer vision tasks, existing supervised video classification methods demand a large amount of labeled data to attain good performance. However, annotation of a large dataset is expensive and time consuming. To minimize the dependence on a large annotated dataset, our proposed semi-supervised method trains from a small number of labeled examples and exploits two regulatory signals from unlabeled data. The first signal is the pseudo-labels of unlabeled examples computed from the confidences of the CNN being trained. The other is the normalized probabilities, as predicted by an image classifier CNN, that captures the information about appearances of the interesting objects in the video. We show that, under the supervision of these guiding signals from unlabeled examples, a video classification CNN can achieve impressive performances utilizing a small fraction of annotated examples on three publicly available datasets: UCF101, HMDB51 and Kinetics.
研究动机与目标
- 减少对大规模标注视频数据集的依赖,因为这些数据集的创建成本高且耗时长。
- 将此前在2D图像任务中有效的半监督学习技术,适配到更具挑战性的时空视频分类领域。
- 通过引入未标记数据的双重监督信号,仅使用少量标注样本,提升3D CNN在视频分类中的表现。
- 探究基于对象级别的特征外观线索是否能在低监督设置下显著提升视频动作识别性能。
提出的方法
- 该方法利用CNN在未标记视频片段上训练时的置信度分数生成伪标签,为模型提供监督信号。
- 通过将预训练的2D图像分类器应用于每段视频的随机帧,引入外观特征,以正则化3D视频分类器。
- 利用2D图像分类器的预测概率作为正则化信号,引导3D CNN学习更具判别性的时空特征。
- 采用端到端训练方式,结合标注数据的监督损失和未标注数据的一致性正则化损失。
- 该方法兼容多种3D CNN架构,包括ResNet-18,并可应用于不同的视频数据集。
- 利用未标记数据中高置信度的预测结果评估模型可靠性,并支持主动学习应用。
实验结果
研究问题
- RQ1为2D图像设计的半监督学习技术能否有效适配到使用3D CNN的视频分类任务中?
- RQ2在低监督设置下,结合2D图像分类器预测的外观线索是否能提升视频分类的准确率?
- RQ3伪标签法和外观正则化在多大程度上能减少对大规模标注视频数据集的需求?
- RQ4在不同视频数据集上,所提方法的性能与完全监督和其它半监督基线方法相比如何?
主要发现
- 在UCF101、HMDB51和Kinetics数据集上,当仅使用10%–20%的标注数据时,VideoSSL的准确率比完全监督训练高出最多20%。
- 仅使用10%的标注数据,VideoSSL的准确率即超过先前研究中使用完整数据集训练的完全监督3D ResNet-18模型的性能。
- 在UCF101的90%类别中,当使用10%的标签时,该方法的top-1准确率高于监督基线模型,特定动作如拳击和击剑的提升超过40%。
- 超过90%的未标记视频被高置信度(>0.95)正确分类,表明模型具有强可靠性,具备主动学习潜力。
- 通过利用外观线索,该方法显著减少了监督模型中常见的误分类错误,例如将“飞盘投掷”与“足球传球”混淆。
- 伪标签法与外观正则化相结合,在所有三个基准数据集上均带来一致的性能提升,展现出良好的鲁棒性与泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。