Skip to main content
QUICK REVIEW

[논문 리뷰] Revisiting Realistic Test-Time Training: Sequential Inference and Adaptation by Anchored Clustering

Yongyi Su, Xun Xu|arXiv (Cornell University)|2022. 06. 06.
Domain Adaptation and Few-Shot Learning인용 수 12
한 줄 요약

이 논문은 도메인 적응을 향상시키기 위해 KL 발산 최소화를 통해 타겟 도메인 특징을 소스 도메인 클러스터에 정렬함으로써 순차적 테스트 시간 학습(sTTT)을 위한 Test-Time Anchored Clustering(TTAC)을 제안한다. TTAC는 온라인 클러스터 업데이트를 위해 지수 이동 평균을 사용하고, 강건성을 확보하기 위해 의사 레이블 필터링을 적용하며, 반복적 개선을 통해 기존의 SOTA 방법들보다 일관되게 뛰어난 성능을 보인다. 이는 소스 학습 목표를 수정하지 않고도 실제 sTTT 프로토콜에서 여섯 개의 데이터셋에 대해 항상 슈퍼리어하다.

ABSTRACT

Deploying models on target domain data subject to distribution shift requires adaptation. Test-time training (TTT) emerges as a solution to this adaptation under a realistic scenario where access to full source domain data is not available and instant inference on target domain is required. Despite many efforts into TTT, there is a confusion over the experimental settings, thus leading to unfair comparisons. In this work, we first revisit TTT assumptions and categorize TTT protocols by two key factors. Among the multiple protocols, we adopt a realistic sequential test-time training (sTTT) protocol, under which we further develop a test-time anchored clustering (TTAC) approach to enable stronger test-time feature learning. TTAC discovers clusters in both source and target domain and match the target clusters to the source ones to improve generalization. Pseudo label filtering and iterative updating are developed to improve the effectiveness and efficiency of anchored clustering. We demonstrate that under all TTT protocols TTAC consistently outperforms the state-of-the-art methods on six TTT datasets. We hope this work will provide a fair benchmarking of TTT methods and future research should be compared within respective protocols. A demo code is available at https://github.com/Gorilla-Lab-SCUT/TTAC.

연구 동기 및 목표

  • 테스트 시간 학습(TTT) 평가 프로토콜의 혼란을 해결하기 위해 기존 방법들을 소스 목표 함수 수정 여부와 순차적 추론 여부라는 두 가지 핵심 요소에 따라 분류한다.
  • 테스트 샘플이 한 개씩 도착하고 즉각적인 추론이 요구되며, 소스 데이터에 접근하거나 소스 학습 목표 함수를 수정할 수 없는 현실적인 조건에서 작동하는 순차적 테스트 시간 학습(sTTT) 프로토콜을 설정한다.
  • KL 발산을 최소화하여 타겟 도메인 클러스터를 소스 도메인의 카테고리별 통계치와 매칭함으로써 특징 일반화를 향상시키는 테스트 시간 고정 클러스터링 방법인 TTAC를 개발한다.
  • 예측 신뢰도 기반 의사 레이블 필터링과 메모리 효율적인 지수 이동 평균 전략을 통한 반복적 모델 업데이트를 통해 강건성과 효율성을 향상시킨다.
  • TTAC이 여섯 개의 TTT 벤치마크 데이터셋에서 모든 TTT 프로토콜, 특히 sTTT에서도 뛰어난 성능을 보임을 입증하고, 향후 연구에서 프로토콜 별 벤치마킹의 중요성을 홍보한다.

제안 방법

  • TTAC는 각 성분이 클래스에 대응하는 혼합 정규분포를 사용하여 소스 및 타겟 도메인의 클러스터를 발견하고, 카테고리별 소스 통계치를 앵커로 사용한다.
  • 테스트 시간 최적화 중에 타겟 성분 정규분포와 소스 앵커 간의 KL 발산을 최소화하여 타겟 도메인 클러스터를 소스 앵커에 매칭한다.
  • 신규 테스트 샘플이 도착함에 따라 지수 이동 평균(EMA) 전략을 사용하여 타겟 클러스터 통계치를 점진적으로 업데이트함으로써 sTTT 프로토콜 하에서 온라인 학습을 가능하게 한다.
  • 낮은 예측 신뢰도를 가진 샘플을 기각함으로써 의사 레이블 필터링을 적용하여 잘못된 할당으로 인한 노이즈를 줄이고 클러스터 품질을 향상시킨다.
  • 필터링된 샘플은 성분 정규분포를 업데이트하는 데 사용되고, 필터링되지 않은 샘플은 전역적 특징 정렬 손실에 기여하여 유용한 정보를 유지한다.
  • 소스 목표 함수 수정이 허용된다면 기존의 TTT 기법들(예: 대비 학습)과도 호환되어 추가적인 성능 향상을 이끌 수 있다.

실험 결과

연구 질문

  • RQ1기존 문헌에서 표준화된 프로토콜이 부족한 상황에서 테스트 시간 학습은 어떻게 공정하게 평가할 수 있는가?
  • RQ2실제 테스트 시간 학습 프로토콜을 구분짓는 데 핵심이 되는 요소는 무엇이며, 이는 방법의 성능와 재현 가능성에 어떻게 영향을 미치는가?
  • RQ3소스 도메인 통계치를 고정 앵커로 사용하는 고정 클러스터링은 소스 학습 목표 함수를 수정하지 않고도 테스트 시간 특징 학습을 향상시킬 수 있는가?
  • RQ4예측 신뢰도 기반 의사 레이블 필터링은 테스트 시간 클러스터링의 강건성과 정확도를 어떻게 향상시키는가?
  • RQ5반복적 업데이트와 샘플 큐 사용은 테스트 시간 적응 방법의 성능와 효율성에 어느 정도의 영향을 미치는가?

주요 결과

  • TTAC는 모든 TTT 프로토콜, 특히 가장 현실적인 sTTT 설정에서 여섯 개의 TTT 벤치마크 데이터셋에서 기존 SOTA 방법들을 일관되게 능가한다.
  • CIFAR10-C의 수준 5 눈송이 오염 조건에서, 샘플 큐와 4개의 업데이트 에포크를 사용한 sTTT 환경에서 TTAC는 상위 1 오차율 10.88을 기록하여 TENT(13.87)와 SHOT(13.75)를 모두 앞선다.
  • 소스 도메인 통계 정보가 전혀 없을 경우에도 TTAC는 ImageNet-C에서 11.91% 오차율을 기록하여 모든 경쟁 방법을 능가하며, 최소한의 가정 하에서도 강력한 일반화 능력을 입증한다.
  • 분포 추정 기반 방법들인 TTAC와 SHOT의 경우, 테스트 샘플 큐 유지가 성능 향상에 크게 기여하며, 업데이트 에포크 수가 1에서 4로 증가함에 따라 ImageNet-C에서 오차율이 11.91%에서 9.96%로 감소한다.
  • TTAC의 샘플당 월 타임은 큐 없이 0.0083초, 4-에포크 큐를 사용할 경우 4096개 샘플 기준 0.1524초로, 배치 정규화(BN)와 TENT보다 오직 두 배 정도 느리지만 더 높은 정확도를 제공한다.
  • 절단 분석 결과, 샘플 큐와 다중 업데이트 에포크 모두 성능 향상에 필수적임을 확인하였으며, TTAC는 모든 설정에서 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.