Skip to main content
QUICK REVIEW

[论文解读] Privileged Knowledge Distillation for Online Action Detection

Peisen Zhao, Lingxi Xie|arXiv (Cornell University)|Nov 18, 2020
Human Pose and Action Recognition参考文献 44被引用 7
一句话总结

本文提出了一种新型知识蒸馏框架——特权知识蒸馏(Privileged Knowledge Distillation, PKD),用于在线动作检测。该方法在训练过程中利用未来视频帧作为特权信息,通过课程学习和辅助节点,弥合了离线教师模型(拥有完整视频)与在线学生模型(仅能访问当前及过去帧)之间的输入数据差异。PKD在TVSeries数据集上达到86.44%的mcAP,在THUMOS14数据集上达到64.45%的mAP,性能达到当前最先进水平。

ABSTRACT

Online Action Detection (OAD) in videos is proposed as a per-frame labeling task to address the real-time prediction tasks that can only obtain the previous and current video frames. This paper presents a novel learning-with-privileged based framework for online action detection where the future frames only observable at the training stages are considered as a form of privileged information. Knowledge distillation is employed to transfer the privileged information from the offline teacher to the online student. We note that this setting is different from conventional KD because the difference between the teacher and student models mostly lies in input data rather than the network architecture. We propose Privileged Knowledge Distillation (PKD) which (i) schedules a curriculum learning procedure and (ii) inserts auxiliary nodes to the student model, both for shrinking the information gap and improving learning performance. Compared to other OAD methods that explicitly predict future frames, our approach avoids learning unpredictable unnecessary yet inconsistent visual contents and achieves state-of-the-art accuracy on two popular OAD benchmarks, TVSeries and THUMOS14.

研究动机与目标

  • 解决实时在线动作检测中推理时仅能访问当前及过去帧的挑战。
  • 在训练过程中利用可获得的未来帧作为特权信息,以提升在线模型的性能。
  • 通过设计针对输入差异而非网络结构差异的专属知识蒸馏框架,克服教师模型(完整视频)与学生模型(部分输入)之间的不匹配问题。
  • 通过辅助节点与课程学习减少教师与学生模型之间的信息差距,从而提升早期动作检测性能。

提出的方法

  • 提出一种知识蒸馏框架,其中在完整视频序列上训练的离线教师模型,指导仅观察当前及过去帧的在线学生模型。
  • 通过课程学习策略,让学生逐步在一系列中间教师模型上进行训练,这些教师模型所能看到的未来帧序列由短到长逐步增加。
  • 在学生网络的每一层中插入辅助节点,以正则化特定特征表示,从而在不依赖相同网络结构的前提下,实现与教师输出更好的对齐。
  • 利用知识蒸馏将教师模型的高层语义知识传递给学生模型,隐式引导学生模型在无需显式预测未来帧的情况下,提前感知未来动作语义。
  • 基于软标签知识迁移构建蒸馏损失,使学生模型学习匹配教师模型的动作分类概率分布。
  • 通过结合真实标签的交叉熵损失与教师模型的蒸馏损失,对学⽣模型进行端到端优化,并采用课程学习调度策略以稳定训练过程。

实验结果

研究问题

  • RQ1在训练过程中可获得的未来视频帧能否被有效用作特权信息,以提升在线动作检测性能?
  • RQ2当教师与学生模型之间的主要差异在于输入数据而非网络结构时,知识蒸馏应如何调整以弥合两者之间的差距?
  • RQ3课程学习是否通过逐步向学生暴露更复杂的特权信息,从而改善在线动作检测中的蒸馏过程?
  • RQ4学生网络中的辅助节点是否有助于减少信息差距并改善与教师模型的特征对齐?
  • RQ5与显式未来帧预测方法相比,所提出方法在在线动作检测任务中是否在准确率与效率方面均表现更优?

主要发现

  • 所提出的PKD框架在TVSeries基准上达到86.44%的mcAP,在THUMOS14基准上达到64.45%的mAP,性能达到当前最先进水平。
  • PKD在THUMOS14上超越所有先前方法(包括使用显式未来帧预测的方法,如TRN和F2G)超过1.7个百分点。
  • 该方法在所有动作阶段均表现优异,尤其在动作进行到60%-70%时达到最高的89.0% mcAP,表明其具备强大的早期检测能力。
  • 定性结果表明,PKD能够检测到此前被遗漏的动作实例,如"Fall"、"Answer phone"和"Drive car",在TVSeries上展现出更强的检测鲁棒性。
  • 消融实验验证了课程学习与辅助节点均对性能提升有显著贡献,二者结合时效果最佳。
  • 该方法在时间序列上表现出稳定且准确的预测能力,如在"Hammer Throw"动作序列中输出一致,而基线模型则表现更不稳定。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。