[论文解读] Classification-Reconstruction Learning for Open-Set Recognition
本文提出 CROSR,一种用于开放集识别的深度学习框架,通过使用分层瓶颈潜在表示,联合训练网络以实现输入数据的分类与重建。通过结合预测特征和重建特征,CROSR 在多个数据集上实现了最先进的未知类别检测性能,同时保持了已知类别分类的准确性。
Open-set classification is a problem of handling `unknown' classes that are not contained in the training dataset, whereas traditional classifiers assume that only known classes appear in the test environment. Existing open-set classifiers rely on deep networks trained in a supervised manner on known classes in the training set; this causes specialization of learned representations to known classes and makes it hard to distinguish unknowns from knowns. In contrast, we train networks for joint classification and reconstruction of input data. This enhances the learned representation so as to preserve information useful for separating unknowns from knowns, as well as to discriminate classes of knowns. Our novel Classification-Reconstruction learning for Open-Set Recognition (CROSR) utilizes latent representations for reconstruction and enables robust unknown detection without harming the known-class classification accuracy. Extensive experiments reveal that the proposed method outperforms existing deep open-set classifiers in multiple standard datasets and is robust to diverse outliers. The code is available in https://nae-lab.org/~rei/research/crosr/.
研究动机与目标
- 解决深度学习中封闭世界假设的局限性,即在训练期间未预料到未见类别。
- 克服监督表示的特化问题,该问题阻碍了对未知类别的检测。
- 通过将无监督重建学习作为正则化项,整合到开放集识别中,以保留判别性和泛化性特征。
- 开发一个统一框架,在保持已知类别分类高准确率的同时,实现对未知类别的鲁棒检测。
- 设计一种新型架构 DHRNet,以联合学习用于分类的分层表示,以及用于异常检测的紧凑、信息丰富的潜在编码。
提出的方法
- 端到端训练深度神经网络,同时使用对数几率的监督损失进行分类,以及使用潜在编码的自编码器风格损失进行重建。
- 引入深度分层重建网络(DHRNets),通过瓶颈化侧向连接学习多层级、紧凑的潜在表示以实现重建。
- 将分类对数几率 $\boldsymbol{y}$ 和重建潜在编码 $\boldsymbol{z}$ 的拼接作为未知检测的最终表示。
- 在 $[\boldsymbol{y}, \boldsymbol{z}]$ 上应用 $\ell^2$ 距离或单类异常检测器(如 OCSVM、孤立森林)以检测异常值。
- 利用 DHRNets 的分层结构在多个层级提取异常因子,提升对多样化未知样本的鲁棒性。
- 使用联合损失函数优化网络,以在中间层平衡分类准确率与重建保真度。
实验结果
研究问题
- RQ1联合分类-重建学习是否能提升深度特征在开放集识别中的泛化能力?
- RQ2在不降低已知类别分类性能的前提下,引入无监督重建学习是否能增强检测未知类别的能力?
- RQ3与标准自编码器相比,DHRNet 中的分层瓶颈表示是否能更好地保留用于区分未知与已知类别的信息?
- RQ4与仅使用分类对数几率 $\boldsymbol{y}$ 相比,使用多层级潜在表示 $\boldsymbol{z}$ 如何提升异常检测性能?
- RQ5CROSR 是否能在不使用合成训练数据的情况下,在标准基准上超越基于 GAN 的及其他最先进开放集分类器?
主要发现
- CROSR 在 MNIST、SVHN 和 TinyImageNet 上均达到最先进性能,F1 分数分别为 0.991 ± 0.004、0.899 ± 0.018 和 0.589,优于 OpenMax 和基于 GAN 的基线方法。
- 该方法在保持高已知类别分类准确率的同时,显著提升了对未知类别的检测能力,尤其在具有挑战性的、外观相似的异常样本上表现突出。
- 将 $\ell^2$ 距离替换为在 $[\boldsymbol{y}, \boldsymbol{z}]$ 上的 OCSVM,使合成异常样本的 F1 分数提升超过 15%,证明了联合表示的实用性。
- t-SNE 可视化结果表明,与仅使用 $\boldsymbol{y}$ 相比,$[\boldsymbol{y}, \boldsymbol{z}]$ 表示能更清晰地区分已知类与未知类。
- 计算潜在表示的计算开销极低——每张图像仅需 3–5 毫秒,使 CROSR 在实际部署中具有高效性。
- 尽管未使用合成训练数据,CROSR 的性能与基于 GAN 的方法相当或略优,表明其具备强大的泛化能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。