Skip to main content
QUICK REVIEW

[论文解读] Rapid Adaptation in Online Continual Learning: Are We Evaluating It Right?

Hasan Abed Al Kader Hammoud, Ameya Prabhu|arXiv (Cornell University)|May 16, 2023
Respiratory viral infections researchMedicine被引用 3
一句话总结

本文挑战了在线准确率作为评估在线持续学习(OCL)算法可靠性的度量标准,表明由于数据流中存在虚假的标签相关性,该指标可能具有误导性。作者提出了一种新度量标准——近未来准确率,用于在消除此类相关性后评估模型性能,揭示出具有强知识保留能力的方法在严格计算预算下仍能实现更优的泛化与适应能力。

ABSTRACT

We revisit the common practice of evaluating adaptation of Online Continual Learning (OCL) algorithms through the metric of online accuracy, which measures the accuracy of the model on the immediate next few samples. However, we show that this metric is unreliable, as even vacuous blind classifiers, which do not use input images for prediction, can achieve unrealistically high online accuracy by exploiting spurious label correlations in the data stream. Our study reveals that existing OCL algorithms can also achieve high online accuracy, but perform poorly in retaining useful information, suggesting that they unintentionally learn spurious label correlations. To address this issue, we propose a novel metric for measuring adaptation based on the accuracy on the near-future samples, where spurious correlations are removed. We benchmark existing OCL approaches using our proposed metric on large-scale datasets under various computational budgets and find that better generalization can be achieved by retaining and reusing past seen information. We believe that our proposed metric can aid in the development of truly adaptive OCL methods. We provide code to reproduce our results at https://github.com/drimpossible/EvalOCL.

研究动机与目标

  • 质疑在线准确率作为衡量OCL中真正适应能力的可靠性,因其可能因数据流中的虚假标签相关性而被夸大。
  • 证明最先进的OCL方法即使在遭受灾难性遗忘的情况下,也能实现高在线准确率,表明其依赖于数据特性而非真正的学习。
  • 提出一种新评估度量标准——近未来准确率,通过消除虚假相关性,更真实地反映模型的适应能力。
  • 表明在新度量标准下,具备强信息保留能力的模型表现显著更优,提示保留能力对泛化至关重要。
  • 通过大规模数据集和多样化的计算预算,提供一个稳健的基准,以验证所提出的评估协议。

提出的方法

  • 引入一种名为近未来准确率的新评估度量标准,定义为在移除虚假标签相关性后,对样本前移𝒮步后的准确率。
  • 选择最小的𝒮值,以确保消除与当前数据的标签相关性,同时最小化分布偏移并保证鲁棒性。
  • 设计一种盲基线方法——OverAdapt,通过利用标签相关性实现高在线准确率,尽管其知识保留接近零。
  • 在两个大规模OCL数据集——CGLM和CLOC上,对10余种SOTA OCL方法进行基准测试,涵盖慢速和快速数据流设置,并采用归一化计算预算。
  • 采用公平且计算归一化的评估协议,比较不同优化策略和模型架构下的方法表现。
  • 同时使用近未来准确率和标准度量标准(如在线准确率和信息保留率)评估性能,以对比结果。

实验结果

研究问题

  • RQ1在线准确率能否可靠地衡量OCL中的快速适应能力,还是因其受数据流中虚假标签相关性的影响而被夸大?
  • RQ2最先进的OCL算法在实现高在线准确率时,其依赖程度在多大程度上源于标签相关性而非真正的学习?
  • RQ3通过近未来准确率消除虚假相关性后,是否能揭示OCL模型真正适应能力的更准确图景?
  • RQ4与仅针对快速适应进行优化的模型相比,具备强知识保留能力的模型在新评估度量标准下的表现如何?
  • RQ5当在更严格、无相关性的度量标准下评估时,更简单的基线方法是否可能超越复杂的OCL方法?

主要发现

  • 一种仅利用虚假标签相关性的盲分类器在CGLM上实现了85%的在线准确率,表明高在线准确率并不意味着真正的适应。
  • 所提出的OverAdapt方法在CGLM上实现了88.5%的在线准确率,但信息保留率仅为2.1%,证明其学习的是相关性而非知识。
  • 在近未来准确率度量标准下,CosineFC在CGLM上达到38%的准确率,在CLOC上达到16%,优于大多数SOTA OCL方法。
  • 在快速数据流设置下,简单基线方法如ACM和FC-Only在CGLM上分别实现了29%和21%的近未来准确率,优于复杂的OCL方法。
  • 具备高信息保留能力的方法(如CosineFC)在新度量标准下始终表现出色,表明保留能力有助于实现更好的泛化。
  • 适应能力与保留能力之间的差距并非固有的稳定性-可塑性权衡,而是模型过度拟合于数据流特性的结果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。