Skip to main content
QUICK REVIEW

[论文解读] Customizing Student Networks From Heterogeneous Teachers via Adaptive Knowledge Amalgamation

Chengchao Shen, Mengqi Xue|arXiv (Cornell University)|Aug 20, 2019
Domain Adaptation and Few-Shot Learning参考文献 36被引用 10
一句话总结

本文提出一种双阶段自适应知识融合方法,无需人工标注数据,即可从异构的预训练教师网络中定制一个紧凑的多任务学生网络。通过聚类任务重叠的教师网络、学习模块化组件网络,并利用传输桥从每个样本中选择最不模糊的教师进行特征与预测的有选择性蒸馏,学生网络在细粒度属性识别任务上的表现优于单个教师网络。

ABSTRACT

A massive number of well-trained deep networks have been released by developers online. These networks may focus on different tasks and in many cases are optimized for different datasets. In this paper, we study how to exploit such heterogeneous pre-trained networks, known as teachers, so as to train a customized student network that tackles a set of selective tasks defined by the user. We assume no human annotations are available, and each teacher may be either single- or multi-task. To this end, we introduce a dual-step strategy that first extracts the task-specific knowledge from the heterogeneous teachers sharing the same sub-task, and then amalgamates the extracted knowledge to build the student network. To facilitate the training, we employ a selective learning scheme where, for each unlabelled sample, the student learns adaptively from only the teacher with the least prediction ambiguity. We evaluate the proposed approach on several datasets and experimental results demonstrate that the student, learned by such adaptive knowledge amalgamation, achieves performances even better than those of the teachers.

研究动机与目标

  • 在无法访问人工标注数据的情况下,实现从异构预训练教师网络池中定制紧凑的多任务学生网络。
  • 解决来自多样化、可能重叠或单任务教师的知识融合挑战,同时保留任务特定知识并避免冲突监督。
  • 开发一种选择性学习机制,自适应地为每个样本选择最可靠的教师,以减少噪声并提高训练稳定性。
  • 通过生成可灵活组合的中间组件网络,提升模块化与可重用性,以支持多种用户定义的任务组合。
  • 证明学生网络可通过有效融合互补知识,在性能上超越单个教师网络。

提出的方法

  • 该方法采用两阶段知识融合流程:首先,根据共享任务对源网络进行聚类,以训练单任务组件网络;其次,将这些组件网络融合为最终的多任务目标网络。
  • 对于每个无标签输入样本,学生网络自适应地选择输出概率分布熵最低(即预测最不模糊)的教师进行学习。
  • 知识蒸馏不仅应用于最终预测,还通过专用传输桥对中间特征图进行处理,以对齐特征维度并实现分块特征传输。
  • 传输桥模块确保学生从选定教师处学习到与任务相关的中间表征,从而在logits仅蒸馏之外提供更高级别的特征层面监督。
  • 选择性学习策略为每个样本动态分配最自信的教师,降低来自低置信度或错位教师的负迁移风险。
  • 该方法在多个细粒度数据集上进行评估,消融实验验证了传输桥与教师选择组件的有效性。

实验结果

研究问题

  • RQ1在无须人工标注数据的情况下,是否能够有效训练学生网络,使其在用户定义的任务上表现优于单个教师?
  • RQ2与直接将所有教师合并为单一学生的单次方法相比,双阶段知识融合策略有何优势?
  • RQ3为每个样本选择最不模糊的教师进行选择性学习,对学生网络性能与鲁棒性有何影响?
  • RQ4与标准知识蒸馏相比,能够对齐中间特征的传输桥在多大程度上提升了知识迁移效果?
  • RQ5第一阶段生成的组件网络在多大程度上可被重用于灵活构建多种多任务学生模型,从而提升模块化与可定制性?

主要发现

  • 两阶段融合方法始终优于单次方法,在CelebA数据集上,'Black Hair'任务准确率达到87.6%,'Blond Hair'任务达到95.1%,而单次方法分别为85.6%和86.1%。
  • 引入传输桥模块后,各类属性的性能提升0.4–0.6个百分点,证明其在特征层面监督中的价值。
  • 相比无教师选择机制的知识蒸馏,采用教师选择学习策略使性能提升0.2–0.4个百分点,证实其在减少误导性指导方面的作用。
  • 随着教师数量增加,性能持续提升:在CelebA上,增加源网络数量可使'arched eyebrows'和'high cheekbones'任务的性能更优,表明知识互补性有效。
  • 学生网络在所有目标任务上的表现均优于所有单个教师,证明了知识融合与泛化能力的成功实现。
  • 消融实验确认,传输桥与选择性学习均为关键组件,完整模型相比变体平均提升0.4–0.6个百分点。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。