[论文解读] Isolation and Impartial Aggregation: A Paradigm of Incremental Learning without Interference
该论文提出 ESN,一种无需经验回放的增量学习框架,通过隔离各阶段专用分类器来防止干扰,并利用基于锚点的能量自归一化方法实现公平聚合。通过温度控制的能量度量校准置信度分数,并结合基于投票的推理机制,ESN 在四个基准测试中实现了最先进性能,且遗忘程度极低。
This paper focuses on the prevalent performance imbalance in the stages of incremental learning. To avoid obvious stage learning bottlenecks, we propose a brand-new stage-isolation based incremental learning framework, which leverages a series of stage-isolated classifiers to perform the learning task of each stage without the interference of others. To be concrete, to aggregate multiple stage classifiers as a uniform one impartially, we first introduce a temperature-controlled energy metric for indicating the confidence score levels of the stage classifiers. We then propose an anchor-based energy self-normalization strategy to ensure the stage classifiers work at the same energy level. Finally, we design a voting-based inference augmentation strategy for robust inference. The proposed method is rehearsal free and can work for almost all continual learning scenarios. We evaluate the proposed method on four large benchmarks. Extensive results demonstrate the superiority of the proposed method in setting up new state-of-the-art overall performance. \emph{Code is available at} \url{https://github.com/iamwangyabin/ESN}.
研究动机与目标
- 解决增量学习中各阶段性能不平衡的问题,其中后期阶段易受灾难性遗忘和准确率下降的影响。
- 克服在不同任务上具有不一致置信度分布的阶段专用分类器聚合的挑战。
- 开发一种无需存储历史数据的回放-free范式,同时在所有阶段保持高准确率。
- 通过将输出置信度水平归一化到共享能量平面,确保分类器的公平聚合。
- 设计一种鲁棒的推理机制,通过基于投票的增强策略提升泛化能力。
提出的方法
- 使用固定预训练的视觉Transformer(ViT)主干网络作为冻结的特征提取器,以提供一致的阶段内特征表示。
- 引入温度控制的能量度量,量化并对齐各阶段专用分类器的置信度分数水平。
- 提出基于锚点的能量自归一化损失,强制所有阶段分类器在相同能量平面上运行,从而实现公平聚合。
- 采用类别注意力模块(CAB)作为轻量级、任务专用的解码器,学习阶段专用分类器,而无需微调主干网络。
- 实施基于投票的推理策略,结合所有阶段分类器的预测结果,以提升鲁棒性与泛化能力。
- 基于投票结果采用动态温度选择策略,进一步校准置信度分数并提升性能。
实验结果
研究问题
- RQ1在不使用回放的情况下,能否有效聚合阶段隔离的分类器,同时在所有学习阶段保持公平性?
- RQ2如何对在不同数据分布上训练的分类器的置信度分数进行归一化,以实现公平且鲁棒的集成推理?
- RQ3能量层级对齐对缓解增量学习各阶段性能不平衡的影响是什么?
- RQ4与现有基于回放和无回放的方法相比,该方法在准确率和遗忘控制方面的表现如何?
- RQ5该框架是否能在不施加架构约束的前提下,泛化到不同网络架构和下游任务?
主要发现
- ESN 在 Split CIFAR-100 上实现了 86.34% 的新最先进 FAA,显著优于先前方法。
- 消融研究显示,若移除能量自归一化,FAA 下降 6.13 个百分点,证明其在公平聚合中的关键作用。
- 通过投票实现的温度校准使性能较固定温度基线提升 0.61%,证明其在置信度校准中的有效性。
- 通过类别注意力模块实现的参数隔离至关重要——若在任务间共享 CAB,FAA 相较于隔离设计下降 2.4%。
- 该方法对超参数选择具有鲁棒性:将能量锚点 Δ 从 -15 调整至 0,FAA 仅出现 ±0.38% 的微小波动。
- 在不同架构中,基于 CAB 的 ESN 在性能(86.34% FAA)与参数效率(相对增加 3.4%)之间实现了最佳平衡,尽管参数扩展率较低,仍优于 VPT 和 DER 方法。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。