Skip to main content
QUICK REVIEW

[논문 리뷰] Nearest Neighborhood-Based Deep Clustering for Source Data-absent Unsupervised Domain Adaptation

Song Tang, Yan Yang|arXiv (Cornell University)|2021. 07. 27.
Domain Adaptation and Few-Shot Learning참고 문헌 54인용 수 7
한 줄 요약

이 논문은 소스 데이터가 없음에도 불구하고 사전 훈련된 소스 모델만 이용 가능한, 소스 데이터 부재 비지도 도메인 적응(SAUDA)을 위한 최근접 이웃 기반 딥 클러스터링 방법을 제안한다. 근처 이웃 내에서의 의미 일관성(SCNNH)과 의미적 하이퍼-근처 이웃(SHNNH)을 통한 기하 구조 제약을 활용함으로써, 클러스터링의 강건성과 성능을 향상시키며, 이전 방법 대비 대규모 VisDA-C에서 평균 정확도를 3.0% 향상시켜 최신 기술 수준(SOTA) 성능을 달성한다.

ABSTRACT

In the classic setting of unsupervised domain adaptation (UDA), the labeled source data are available in the training phase. However, in many real-world scenarios, owing to some reasons such as privacy protection and information security, the source data is inaccessible, and only a model trained on the source domain is available. This paper proposes a novel deep clustering method for this challenging task. Aiming at the dynamical clustering at feature-level, we introduce extra constraints hidden in the geometric structure between data to assist the process. Concretely, we propose a geometry-based constraint, named semantic consistency on the nearest neighborhood (SCNNH), and use it to encourage robust clustering. To reach this goal, we construct the nearest neighborhood for every target data and take it as the fundamental clustering unit by building our objective on the geometry. Also, we develop a more SCNNH-compliant structure with an additional semantic credibility constraint, named semantic hyper-nearest neighborhood (SHNNH). After that, we extend our method to this new geometry. Extensive experiments on three challenging UDA datasets indicate that our method achieves state-of-the-art results. The proposed method has significant improvement on all datasets (as we adopt SHNNH, the average accuracy increases by over 3.0% on the large-scaled dataset). Code is available at https://github.com/tntek/N2DCX.

연구 동기 및 목표

  • 개인 정보나 보안 제약으로 인해 소스 데이터를 확보할 수 없는 상황에서 비지도 도메인 적응의 과제를 해결한다.
  • 개별 데이터 기반 딥 클러스터링의 한계를 극복하며, 가짜 레이블 오류에 취약하고 강건성이 떨어지는 문제를 해결한다.
  • 특징 공간 내 국소 기하 구조를 활용하여 클러스터링의 안정성을 향상시킨다.
  • 최근접 이웃 기하학 기반의 새로운 클러스터링 목표 함수를 개발하여 도메인 적응 성능을 향상시킨다.
  • 소스 데이터에 접근할 수 없는 상황에서 기하학적 제약이 자기지도 학습 도메인 적응에 어떻게 기여하는지 입증한다.

제안 방법

  • 국소 데이터 이웃 내에서 일관된 클러스터링을 유도하기 위해, 최근접 이웃 내 의미 일관성(SCNNH)이라는 새로운 기하 제약을 제안한다.
  • 개별 데이터 포인트가 아닌 최근접 이웃 그룹(NNH)을 기반 단위로 삼아 클러스터링을 재정의함으로써 강건성을 향상시킨다.
  • 더 높은 신뢰도를 확보하기 위해 의미적 신뢰성 제약을 통합한 고급 구조인 의미적 하이퍼-근처 이웃(SHNNH)을 도입한다.
  • 특징 공간 내 공간적 근접성과 의미 일관성을 활용하는 기하학적 인식 목표 함수를 구성한다.
  • 홈 샘플을 탐지하고 이웃 구조를 반복적으로 개선함으로써 클러스터링을 정교화하기 위해 체인 검색 기반 메커니즘을 사용한다.
  • 가짜 레이블링과 기하학적 정규화를 결합한 자기지도 목표 함수를 사용해 타겟 모델을 엔드 투 엔드로 훈련시킨다.

실험 결과

연구 질문

  • RQ1국소 데이터 이웃에서 유도된 기하 제약이 소스 데이터 부재 도메인 적응에서 클러스터링의 강건성 향상에 기여하는가?
  • RQ2개별 데이터 포인트 클러스터링 대비 최근접 이웃 수준에서 클러스터링을 모델링할 경우 정확도와 안정성 측면에서 어떤 차이가 있는가?
  • RQ3의미적 신뢰성과 교차 기반 탐지 기법이 SAUDA에서 클러스터링 성능에 미치는 영향은 무엇인가?
  • RQ4소스 데이터가 없을 경우 기하학적 목표 함수가 표준 도메인 정렬 또는 가짜 레이블링 방법보다 우월한 성능을 보일 수 있는가?
  • RQ5국소 유클리드 기하 구조는 딥 클러스터링에서 자기지도 도메인 적응에 얼마나 기여하는가?

주요 결과

  • 제안된 방법은 Office-31, Office-Home, VisDA-C 세 가지 벤치마크 데이터셋에서 최신 기술 수준(SOTA) 성능을 달성한다.
  • 대규모 VisDA-C 데이터셋에서 이전 SOTA 방법 대비 평균 정확도를 3.0% 이상 향상시켜 뚜렷한 성과 향상을 입증한다.
  • 절단 분석 결과, SCNNH 및 SHNNH 구성 요소가 모두 필수적임을 확인하였으며, 체인 검색 또는 신뢰도 그룹화 기능을 제거한 변형보다 N2DC-EX가 뛰어난 성능을 보였다.
  • 전체 방법(N2DC-EX)은 Office-31에서 90.0%, Office-Home에서 73.1%, VisDA-C에서 85.8%의 정확도를 기록하여 모든 절단 변형보다 뛰어난 성능을 보였다.
  • 교차 기반 신뢰도 탐지 기법을 사용한 SHNNH(N2DC-EX-Ce/Cd)는 뛰어난 성능을 보였으며, N2DC-EX-Ce는 Office-31에서 89.9%, VisDA-C에서 84.6%의 정확도를 기록했다.
  • 작은(Office-31) 및 큰(VisDA-C) 벤치마크 데이터셋 모두에서 일관된 성능 향상을 보이며, 다양한 규모의 데이터셋에 대해 강건함을 입증했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.