[论文解读] Discriminability Distillation in Group Representation Learning
本文提出了一种轻量级后处理方法——可区分性蒸馏学习(Discriminability Distillation Learning, DDL),通过从预训练模型中蒸馏嵌入类中心的可区分性分数,增强组表示学习。通过识别可区分性高的元素——以类内距离与最困难负样本类间距离的比值衡量——DDL 实现了高效且可解释的特征聚合,在人脸识别、行人重识别和动作识别任务中均实现了最先进性能,且计算开销极低。
Learning group representation is a commonly concerned issue in tasks where the basic unit is a group, set, or sequence. Previously, the research community tries to tackle it by aggregating the elements in a group based on an indicator either defined by humans such as the quality and saliency, or generated by a black box such as the attention score. This article provides a more essential and explicable view. We claim the most significant indicator to show whether the group representation can be benefited from one of its element is not the quality or an inexplicable score, but the discriminability w.r.t. the model. We explicitly design the discrimiability using embedded class centroids on a proxy set. We show the discrimiability knowledge has good properties that can be distilled by a light-weight distillation network and can be generalized on the unseen target set. The whole procedure is denoted as discriminability distillation learning (DDL). The proposed DDL can be flexibly plugged into many group-based recognition tasks without influencing the original training procedures. Comprehensive experiments on various tasks have proven the effectiveness of DDL for both accuracy and efficiency. Moreover, it pushes forward the state-of-the-art results on these tasks by an impressive margin.
研究动机与目标
- 解决现有组表示学习方法依赖注意力机制或质量分数时存在的可解释性与效率不足问题。
- 寻找一种更基础且可解释的指标,用于选择组内代表性元素。
- 开发一种轻量级蒸馏网络,可高效估计可区分性,而无需微调基础模型。
- 提升基于组的任务(如集合到集合的人脸识别、基于视频的行人重识别和动作识别)的识别准确率与计算效率。
- 在不修改原始网络的前提下,实现可区分性知识在未见数据分布上的泛化能力。
提出的方法
- 将可区分性定义为元素到其类中心距离与其到最近困难负样本类中心距离的比值,利用预训练模型的嵌入表示。
- 训练一个轻量级可区分性蒸馏网络(DDNet),从原始输入图像回归正则化的可区分性分数。
- 在推理阶段应用 DDNet 为组内所有元素打分,并利用这些可区分性权重进行特征聚合。
- 引入一种过滤策略,仅选择高可区分性元素,从而在保持性能的同时降低计算成本。
- 通过将二维卷积替换为三维卷积,使相同 DDNet 架构适用于基于视频的应用。
- 将 DDL 作为即插即用模块集成,无需微调基础网络,确保灵活性与兼容性。
实验结果
研究问题
- RQ1通过类间与类内距离定义的可区分性,是否可作为比注意力机制或质量分数更可解释、更有效的组表示学习指标?
- RQ2轻量级蒸馏网络能否在不微调基础模型的前提下,从原始输入中准确高效地回归可区分性分数?
- RQ3蒸馏得到的可区分性知识是否能在未见数据和多样化组基识别任务中良好泛化?
- RQ4DDL 是否能在基于视频的行人重识别和动作识别等任务中提升识别准确率并降低计算成本?
- RQ5在未修剪和修剪的视频数据集上,DDL 与密集采样、随机采样和均匀采样相比,在准确率与效率方面表现如何?
主要发现
- 在集合到集合的人脸识别任务中,DDL 相比平均池化提升了 3.6% 的 mAP,且优于注意力机制和基于 RNN 的聚合方法。
- 在 Mars 数据集上,DDL 达到了 77.7% 的 mAP 和 84.0% 的 CMC-1,分别领先之前最先进方法 1.0% 和 2.2%。
- 在 ActivityNet-1.2 上,DDL 仅使用 9 个片段便实现了相比随机采样或均匀采样的 4% 准确率提升,且优于使用 5 倍片段的密集采样 2.49%。
- 在 Kinetics-700 上,DDL 相比随机采样提升了 1.84% 准确率,相比均匀采样提升了 2.18%,同时相比密集采样实现了 6 倍加速。
- DDNet 计算效率极高,仅需基础模型计算量的一小部分,通过选择性特征提取显著提升了推理速度。
- 该方法在多样化任务中泛化良好,包括人脸识别、行人重识别和动作识别,且无需修改基础网络。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。