[论文解读] Diagnosing Batch Normalization in Class Incremental Learning
本文识别出一个关键问题——'BN困境',即在类别增量学习(Class-IL)中,标准批量归一化(BN)会损害表示学习并导致分类器偏差,从而加剧灾难性遗忘。作者提出BN技巧:通过仅使用新类别纯样本进行训练以改善特征学习,并通过使用均衡样本(旧类与新类样本数量相等)单独更新EMA统计量以减少偏差,从而在不引入额外超参数的情况下,在ER、DER++和iCaRL等方法上实现显著的准确率提升。
Extensive researches have applied deep neural networks (DNNs) in class incremental learning (Class-IL). As building blocks of DNNs, batch normalization (BN) standardizes intermediate feature maps and has been widely validated to improve training stability and convergence. However, we claim that the direct use of standard BN in Class-IL models is harmful to both the representation learning and the classifier training, thus exacerbating catastrophic forgetting. In this paper we investigate the influence of BN on Class-IL models by illustrating such BN dilemma. We further propose BN Tricks to address the issue by training a better feature extractor while eliminating classification bias. Without inviting extra hyperparameters, we apply BN Tricks to three baseline rehearsal-based methods, ER, DER++ and iCaRL. Through comprehensive experiments conducted on benchmark datasets of Seq-CIFAR-10, Seq-CIFAR-100 and Seq-Tiny-ImageNet, we show that BN Tricks can bring significant performance gains to all adopted baselines, revealing its potential generality along this line of research.
研究动机与目标
- 调查标准批量归一化(BN)在类别增量学习(Class-IL)中的有害作用,特别是其对灾难性遗忘的贡献。
- 识别BN困境:推理过程中BN统计量偏离导致新类别特征学习差和分类器偏差。
- 提出BN技巧——一种简单且无需超参数调整的方法——以提升基于回放的Class-IL模型的特征提取器质量并消除分类偏差。
- 在多个基准数据集和基线方法(ER、DER++、iCaRL)上验证BN技巧的有效性与泛化能力。
提出的方法
- 仅使用包含新类别样本的批次训练网络,以改善特征学习,并防止新类别表征被旧类别缓存样本所主导。
- 使用均衡批次(旧类与新类样本数量相等)单独更新BN层的指数移动平均(EMA)统计量,以减少分类器偏差。
- 利用更新后的EMA统计量将学习到的表征准确传递至推理阶段,最大限度减少分布偏移。
- 通过修改训练过程和统计量更新方式,将BN技巧应用于现有基于回放的方法(ER、DER++、iCaRL),而无需改变网络架构或引入新超参数。
- 在BN统计量更新后,进一步在缓存样本上进行训练,以模拟推理条件,确保分类的鲁棒性与公平性。
实验结果
研究问题
- RQ1标准批量归一化在类别增量学习中如何导致灾难性遗忘?
- RQ2为何在BN层中使用EMA统计量会导致持续学习场景下的分类器偏差?
- RQ3通过分别改善新类别的特征学习并校正BN统计量,能否缓解BN困境?
- RQ4BN技巧在不同基于回放的Class-IL基线方法上能实现多大程度的性能提升?
主要发现
- 在Seq-CIFAR-10上,BN技巧相较ER实现17%的绝对准确率提升,且反向迁移(BWT)降低46%,表明性能显著增强。
- DER++-BNT显著改善BWT并保持对旧任务的更高准确率,表现出更强的稳定性和公平性。
- iCaRL-BNT在所有任务上(包括最终任务)均优于iCaRL,尽管其BWT得分较低,表明BWT在评估持续学习模型时可能具有误导性。
- BN技巧的性能增益在不同缓存大小下保持一致,并且在Seq-CIFAR-100-20和Seq-Tiny-ImageNet-20的长任务序列(20个任务)中依然有效。
- 可视化结果(t-SNE)证实,ER-BNT产生的类边界更清晰,且相较于标准ER,旧样本被错误分类至新类别的现象显著减少。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。