Skip to main content
QUICK REVIEW

[论文解读] Revisiting Realistic Test-Time Training: Sequential Inference and Adaptation by Anchored Clustering

Yongyi Su, Xun Xu|arXiv (Cornell University)|Jun 6, 2022
Domain Adaptation and Few-Shot Learning被引用 12
一句话总结

本文提出测试时锚定聚类(TTAC),一种用于顺序测试时训练(sTTT)的方法,通过最小化KL散度将目标域特征对齐到源域聚类,从而提升域自适应性能。TTAC采用指数移动平均实现在线聚类更新,通过伪标签过滤提升鲁棒性,并结合迭代优化,在不修改源训练目标的前提下,于六组数据集上持续优于当前最优方法,且符合现实的sTTT协议。

ABSTRACT

Deploying models on target domain data subject to distribution shift requires adaptation. Test-time training (TTT) emerges as a solution to this adaptation under a realistic scenario where access to full source domain data is not available and instant inference on target domain is required. Despite many efforts into TTT, there is a confusion over the experimental settings, thus leading to unfair comparisons. In this work, we first revisit TTT assumptions and categorize TTT protocols by two key factors. Among the multiple protocols, we adopt a realistic sequential test-time training (sTTT) protocol, under which we further develop a test-time anchored clustering (TTAC) approach to enable stronger test-time feature learning. TTAC discovers clusters in both source and target domain and match the target clusters to the source ones to improve generalization. Pseudo label filtering and iterative updating are developed to improve the effectiveness and efficiency of anchored clustering. We demonstrate that under all TTT protocols TTAC consistently outperforms the state-of-the-art methods on six TTT datasets. We hope this work will provide a fair benchmarking of TTT methods and future research should be compared within respective protocols. A demo code is available at https://github.com/Gorilla-Lab-SCUT/TTAC.

研究动机与目标

  • 为解决测试时训练(TTT)评估协议中的混淆问题,基于两个关键因素——源目标函数修改与顺序推理——对现有方法进行分类。
  • 建立一种现实的TTT协议——顺序测试时训练(sTTT)——其中测试样本按顺序逐一到达,推理必须即时完成,且无法访问源数据或修改源训练目标。
  • 提出TTAC,一种测试时锚定聚类方法,通过KL散度最小化将目标域聚类与源域类别级统计量对齐,以提升特征泛化能力。
  • 通过基于预测置信度的伪标签过滤与基于内存高效指数移动平均策略的迭代模型更新,提升鲁棒性与效率。
  • 在所有TTT协议(包括sTTT)下,于六组TTT基准数据集上展示TTAC的优越性,并倡导未来研究采用协议特定的基准测试。

提出的方法

  • TTAC使用高斯混合模型在源域与目标域中发现聚类,其中每个分量对应一个类别,并将类别级源统计量作为锚点。
  • 在测试时优化过程中,通过最小化目标分量高斯分布与源锚点之间的KL散度,将目标域聚类与源锚点匹配。
  • 采用指数移动平均(EMA)策略,随新测试样本到达逐步更新目标聚类统计量,实现在sTTT协议下的在线学习。
  • 通过丢弃预测置信度较低的样本实施伪标签过滤,减少错误分配带来的噪声,提升聚类质量。
  • 经过滤的样本用于更新分量高斯分布,而未过滤样本则贡献于全局特征对齐损失,以保留有用信息。
  • 若允许修改源目标函数,TTAC可与现有TTT技术(如对比学习)兼容,实现进一步性能提升。

实验结果

研究问题

  • RQ1在现有文献缺乏标准化协议的背景下,如何实现测试时训练的公平评估?
  • RQ2现实测试时训练协议的关键差异因素是什么?它们如何影响方法性能与可复现性?
  • RQ3在不修改源训练目标的前提下,能否通过将源域统计量作为固定锚点的锚定聚类来提升测试时特征学习?
  • RQ4基于预测置信度的伪标签过滤如何提升测试时聚类的鲁棒性与准确性?
  • RQ5迭代更新与样本队列的使用在多大程度上影响测试时自适应方法的性能与效率?

主要发现

  • TTAC在所有TTT协议(包括最现实的sTTT设置)下,于六组TTT基准数据集上持续优于当前最优方法,包括CIFAR10-C与ImageNet-C。
  • 在CIFAR10-C(等级5雪灾噪声)下,TTAC在sTTT设置中使用样本队列与4轮更新时,取得10.88%的top-1错误率,优于TENT(13.87%)与SHOT(13.75%)。
  • 即使不使用任何源域统计信息,TTAC在ImageNet-C上仍取得11.91%的错误率,超越所有对比方法,证明其在最小假设下的强大泛化能力。
  • 维持测试样本队列可显著提升分布估计类方法(如TTAC与SHOT)的性能,随着更新轮次从1增至4,ImageNet-C上的错误率从11.91%降至9.96%。
  • TTAC的单样本墙时延为0.0083秒(无队列)与0.1524秒(4轮队列,共4096个样本),仅比BN与TENT慢两倍,但准确率更高。
  • 消融实验确认,样本队列与多轮更新均对性能至关重要,TTAC在所有设置中均表现出一致的性能提升。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。