[论文解读] Two Stream Self-Supervised Learning for Action Recognition
本文提出了一种用于动作识别的双流自监督学习框架,通过将帧序和时空对应关系结合为四分类分类任务,联合学习空间与时间表征。该方法在HMDB51、UCF101和HDD数据集上相较于随机初始化实现了稳定的准确率提升,显示出更强的泛化能力,尤其在长尾分布数据上表现更优。
We present a self-supervised approach using spatio-temporal signals between video frames for action recognition. A two-stream architecture is leveraged to tangle spatial and temporal representation learning. Our task is formulated as both a sequence verification and spatio-temporal alignment tasks. The former task requires motion temporal structure understanding while the latter couples the learned motion with the spatial representation. The self-supervised pre-trained weights effectiveness is validated on the action recognition task. Quantitative evaluation shows the self-supervised approach competence on three datasets: HMDB51, UCF101, and Honda driving dataset (HDD). Further investigations to boost performance and generalize validity are still required.
研究动机与目标
- 通过利用大规模未标注视频进行预训练,解决动作识别中标签视频数据有限的挑战。
- 通过自监督方式将空间特征与运动信号结合,改善时间表征学习。
- 通过更优的特征学习,减少在HDD等长尾数据集上对高频类别的偏差。
- 在无监督监督条件下,验证联合时空表征学习在双流架构中的有效性。
提出的方法
- 采用双流神经网络架构,其中空间分支处理中心RGB帧,运动分支处理六个等距帧之间的帧差(SOD)堆叠。
- 通过在fc6层进行特征相减,将两个分支的特征进行融合,生成时空表征。
- 自监督任务被建模为四分类问题:判断运动序列与帧及其运动编码之间时空对应关系的有效性。
- 采样70帧(约2.5秒)的训练片段,空间分支使用ImageNet预训练权重初始化,运动分支从零开始训练。
- 在下游动作识别数据集上,使用预训练模型进行微调,无需额外标注。
实验结果
研究问题
- RQ1联合自监督学习空间与时间表征是否能提升在小样本监督数据集上的动作识别性能?
- RQ2所提出的时空对齐任务是否能减少在HDD等长尾数据集上对高频类别的偏差?
- RQ3自监督预训练在标准基准上的性能与随机权重初始化相比如何?
- RQ4相较于仅使用运动信号的自监督方法,双流架构结合运动编码在多大程度上提升了特征学习能力?
主要发现
- 在HMDB51上,自监督方法达到33.54%的平均准确率,较随机初始化(31.47%)提升2.07个百分点。
- 在UCF101上,该方法达到56.25%的准确率,较随机权重(52.14%)提升4.11个百分点。
- 在长尾的本田驾驶数据集(HDD)上,自监督方法达到82.78%的准确率,优于随机初始化(81.72%),且对罕见事件的偏差更小。
- 训练损失曲线显示,使用ImageNet预训练的空间分支在小数据集上快速过拟合,表明自监督预训练有助于稳定学习过程。
- 在三个差异显著的数据集上均保持一致的性能提升,表明所提方法具有鲁棒性和强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。