Skip to main content
QUICK REVIEW

[论文解读] Student Becoming the Master: Knowledge Amalgamation for Joint Scene Parsing, Depth Estimation, and More

Jingwen Ye, Yixin Ji|arXiv (Cornell University)|Apr 23, 2019
Advanced Vision and Imaging参考文献 23被引用 10
一句话总结

本文提出了一种新颖的知识融合框架,通过蒸馏来自两个预训练的、任务专用的教师模型的知识,训练一个轻量级、单一的学生模型,使其联合执行场景解析和深度估计任务,且无需使用人工标注数据。该方法采用逐块训练策略,将学生模型的特征投影到每个教师的特征空间以计算损失,使学生在性能上超越两个教师的同时,参数量显著更小。

ABSTRACT

In this paper, we investigate a novel deep-model reusing task. Our goal is to train a lightweight and versatile student model, without human-labelled annotations, that amalgamates the knowledge and masters the expertise of two pretrained teacher models working on heterogeneous problems, one on scene parsing and the other on depth estimation. To this end, we propose an innovative training strategy that learns the parameters of the student intertwined with the teachers, achieved by 'projecting' its amalgamated features onto each teacher's domain and computing the loss. We also introduce two options to generalize the proposed training strategy to handle three or more tasks simultaneously. The proposed scheme yields very encouraging results. As demonstrated on several benchmarks, the trained student model achieves results even superior to those of the teachers in their own expertise domains and on par with the state-of-the-art fully supervised models relying on human-labelled annotations.

研究动机与目标

  • 开发一种无需访问人工标注数据即可训练轻量级、多功能学生模型的方法,使其融合来自异构预训练教师模型的知识。
  • 解决跨领域场景下的知识蒸馏挑战,其中教师模型分别专注于不同任务,如场景解析和深度估计。
  • 设计一种训练策略,使学生能够学习与多个教师模型交织的参数,从而实现超越单个教师模型能力的性能提升。
  • 将该方法推广至三个或更多异构任务,例如增加表面法线估计任务,并采用离线与在线多教师策略。

提出的方法

  • 提出一种逐块训练策略,将学生模型的特征投影到每个教师的特征空间以计算损失,从而实现与两个教师的联合优化。
  • 将学生的特征‘投影’到教师的领域以生成迁移特征,随后用于计算该教师的损失,从而有效对齐学生与两个教师的输出。
  • 该方法假设教师模型具有相同的架构,从而实现不同任务之间的特征空间对齐与知识迁移。
  • 针对多任务知识融合,提出了两种泛化策略:一种是预计算知识迁移的离线方法,另一种是在训练过程中动态适应的在线方法。
  • 学生模型通过无标签图像端到端训练,损失通过将特征投影到两个教师模型上计算,确保学生能同时从两个领域学习。
  • 该方法在 NYUDv2 和 Cityscapes 数据集上进行了验证,使用 SegNet、DepthNet 和 NormNet 作为教师模型,学生网络设计为小于教师模型的集成参数量。

实验结果

研究问题

  • RQ1一个轻量级的学生模型能否在无任何人工标注数据的情况下,有效学习并超越两个分别专注于不同视觉任务(如场景解析和深度估计)的预训练教师模型?
  • RQ2如何有效将具有不同任务目标的异构教师模型的知识融合到单一学生模型中?
  • RQ3在不同领域之间(如场景解析与深度估计)进行知识迁移,是否能带来超越单个教师模型性能的性能提升?
  • RQ4所提出的知识融合策略能否推广至三个或更多异构任务,例如增加表面法线估计任务?
  • RQ5当学生模型在无任何监督的情况下进行训练时,其在各自任务领域的性能相较于教师模型的超越程度如何?

主要发现

  • 在 NYUDv2 数据集上,学生模型在场景解析任务中的平均交并比(mIOU)达到 0.459,超过教师模型的 0.448。
  • 在深度估计任务中,学生模型的绝对相对误差(abs rel)为 0.243,优于教师模型的 0.287。
  • 在 Cityscapes 数据集上,学生模型在场景解析任务中的 mIOU 达到 0.535,在深度估计任务中达到 0.510,分别超过教师模型的 0.521 和 0.289。
  • 学生模型参数量约为 2800 万,其性能与使用人工标注数据且参数量显著更大的最先进全监督模型相当。
  • 当扩展至三任务(场景解析、深度估计与表面法线估计)时,学生模型的性能进一步提升,尤其在深度估计任务中受益于表面法线信息的互补性。
  • 所提方法使学生模型参数量约为教师模型集成的一半,却能在各自任务领域中超越两个教师模型,充分证明了跨领域知识融合的有效性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。