[论文解读] EcoTTA: Memory-Efficient Continual Test-time Adaptation via Self-distilled Regularization
EcoTTA 提出了一种内存高效的持续测试时自适应方法,通过轻量级元网络和自蒸馏正则化,与 SOTA 方法(如 CoTTA)相比,将激活内存减少了 80–86%,并通过来自冻结原始网络的知识蒸馏,有效防止灾难性遗忘和误差累积。
This paper presents a simple yet effective approach that improves continual test-time adaptation (TTA) in a memory-efficient manner. TTA may primarily be conducted on edge devices with limited memory, so reducing memory is crucial but has been overlooked in previous TTA studies. In addition, long-term adaptation often leads to catastrophic forgetting and error accumulation, which hinders applying TTA in real-world deployments. Our approach consists of two components to address these issues. First, we present lightweight meta networks that can adapt the frozen original networks to the target domain. This novel architecture minimizes memory consumption by decreasing the size of intermediate activations required for backpropagation. Second, our novel self-distilled regularization controls the output of the meta networks not to deviate significantly from the output of the frozen original networks, thereby preserving well-trained knowledge from the source domain. Without additional memory, this regularization prevents error accumulation and catastrophic forgetting, resulting in stable performance even in long-term test-time adaptation. We demonstrate that our simple yet effective strategy outperforms other state-of-the-art methods on various benchmarks for image classification and semantic segmentation tasks. Notably, our proposed method with ResNet-50 and WideResNet-40 takes 86% and 80% less memory than the recent state-of-the-art method, CoTTA.
研究动机与目标
- 解决边缘设备上测试时自适应(TTA)中高内存消耗的关键挑战,其中激活内存在反向传播期间占主导地位。
- 克服长期持续 TTA 中的灾难性遗忘和误差累积问题,由于无监督损失优化,模型在源域上性能下降并累积误差。
- 设计一种内存高效的架构,冻结原始网络并仅自适应轻量级元网络,以减少激活存储。
- 提出一种自蒸馏正则化技术,通过约束元网络输出与冻结原始网络输出保持接近,以保留源域知识。
- 在极低内存开销下实现 SOTA 性能,使实际部署成为可能,适用于现实世界中持续变化的环境。
提出的方法
- 提出两部分架构:冻结的预训练主干网络和附加在特定阶段的轻量级元网络(一个 BN 层和一个卷积模块)。
- 仅在测试时自适应过程中更新元网络,避免通过主干网络进行反向传播,从而大幅减少激活内存存储。
- 实施自蒸馏正则化,最小化元网络输出与同一层冻结原始网络输出之间的 L2 距离。
- 将正则化与标准无监督损失(如熵最小化)并行应用,无需额外内存或计算开销。
- 使用模型分割因子 K 控制自适应层的数量,实现性能与内存使用之间的权衡。
- 使用组合损失训练元网络:包括无监督自适应损失(如熵最小化)和自蒸馏正则化损失。

实验结果
研究问题
- RQ1轻量级元网络架构是否能显著降低持续 TTA 中的内存消耗,同时保持性能?
- RQ2自蒸馏正则化是否能有效防止长期持续自适应中的灾难性遗忘和误差累积?
- RQ3在持续 TTA 基准上,EcoTTA 与 SOTA 方法(如 CoTTA)相比,在内存效率和准确性方面表现如何?
- RQ4所提方法是否能在真实边缘部署场景中实现 SOTA 性能且内存开销极低?
- RQ5当通过分割因子 K 调整自适应层数量时,性能与内存消耗之间的权衡关系如何?
主要发现
- 在相同的持续 TTA 设置下,EcoTTA 相较于 CoTTA 将 ResNet-50 和 WideResNet-40 的激活内存消耗分别减少了 86% 和 80%。
- 在 CIFAR-100-C 严重度 5 的设置下,EcoTTA(K=4)的平均误差为 36.4%,仅消耗 80 MB 内存,准确率优于 CoTTA(38.1% 误差,409 MB 内存)及其他 SOTA 方法,且内存使用显著更低。
- 自蒸馏正则化实现了稳定的长期自适应,防止了源域性能下降,并减少了随时间推移的误差累积。
- 即使每个元网络仅包含一个 BN 层和一个卷积模块,EcoTTA 仍能实现具有竞争力的性能,表明极小的参数更新即可带来显著收益。
- 正则化带来的计算开销可忽略不计,因其与自适应损失并行计算,且无需额外内存。
- EcoTTA 在 CIFAR-C 基准中对多种退化类型表现出强大的泛化能力,展示了在分布偏移下持续自适应的鲁棒性。
![Figure 2 : Architecture for test-time adaptation. We illustrate TTA methods: TENT [ 65 ] , EATA [ 50 ] , CoTTA [ 66 ] , and Ours (EcoTTA). TENT and EATA update multiple batch norm layers, in which large activations have to be stored for gradient calculation. In CoTTA, an entire network is trained wi](https://ar5iv.labs.arxiv.org/html/2303.01904/assets/x2.png)
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。