Skip to main content
QUICK REVIEW

[논문 리뷰] On the Value of Target Data in Transfer Learning

Steve Hanneke, Samory Kpotufe|arXiv (Cornell University)|2020. 02. 12.
Domain Adaptation and Few-Shot Learning인용 수 16
한 줄 요약

이 논문은 원천 및 타겟 데이터의 표본 크기를 고려하여 전이 학습의 최소최대 비율을 확립하며, 레이블이 부여된 타겟 데이터와 레이블이 부여되지 않은 타겟 데이터의 가치를 측정하기 위해 새로운 불일치 척도인 전이 지수($ ho$ 및 $ ho$)를 도입한다. 최적의 성능는 원천 또는 타겟 데이터셋 중 정보량이 적은 쪽을 무시함으로써 달성되며, 분포 매개변수나 $ ho$를 추정하지 않더라도 최소최대 성능에 근접하는 데이터 기반 방법을 제안하여 비용 최소화 기반의 샘플링 결정을 가능하게 한다.

ABSTRACT

We aim to understand the value of additional labeled or unlabeled target data in transfer learning, for any given amount of source data; this is motivated by practical questions around minimizing sampling costs, whereby, target data is usually harder or costlier to acquire than source data, but can yield better accuracy. To this aim, we establish the first minimax-rates in terms of both source and target sample sizes, and show that performance limits are captured by new notions of discrepancy between source and target, which we refer to as transfer exponents.

연구 동기 및 목표

  • 샘플링 비용 제약 조건 하에서 전이 학습에서 레이블이 부여된 타겟 데이터와 레이블이 부여되지 않은 타겟 데이터의 가치를 이해하는 것.
  • 원천($n_P$) 및 타겟($n_Q$) 표본 크기에 따라 의존하는 전이 학습의 최소최대 비율을 설정하는 것.
  • 분포 매개변수나 불일치 척도를 알 필요 없이 샘플링 비용 최소화 및 원천 선택과 같은 실용적인 의사결정 전략을 개발하는 것.
  • 전이 지수를 알고 있다면, 단순한 분류기로 하나의 데이터셋을 무시함으로써 최적의 성능를 달성할 수 있음을 보여주는 것.

제안 방법

  • 원천과 타겟 간의 분포 차이를 측정하는 두 가지 새로운 불일치 척도인 초과 위험 전이 지수$\rho$ 및 근사 전이 지수$\gamma$를 도입한다.
  • 일반적인 유한-VC 차원 클래스에 대해 $n_P$, $n_Q$, 그리고 전이 지수 $\rho$ 및 $\gamma$에 따라 최소최대 비율을 유도한다.
  • 분포 매개변수나 $\rho$, $\gamma$를 알 필요 없이 원천 오차가 낮은 조건 하에 타겟 오차를 최적화하는 가설 전이 방법을 제안한다.
  • 저비용의 샘플링 복잡도로 근사 최적 성능를 달성할 수 있도록, 레이블이 부여되지 않은 타겟 데이터($U_Q$)를 사용해 재가중치 설정 방식을 추정한다.
  • 강건성 조건(RCS)과 버르스테인 클래스 가정을 적용하여 초과 위험를 상한으로 제한하고, 최소한의 가정 하에서도 수렴성을 보장한다.
  • 레이블이 부여되지 않은 데이터와 레이블이 부여된 원천 데이터만을 사용하여 초과 위험 상한을 최소화하는 데이터 기반 선택 규칙을 적용한다.

실험 결과

연구 질문

  • RQ1원천 및 타겟 레이블이 부여된 데이터가 모두 존재할 때 전이 학습의 최적 수렴 비율은 무엇인가?
  • RQ2원천 및 타겟 데이터를 조합한 분류기의 성능는 단일 데이터셋을 사용할 때와 비교해 어떻게 되는가?
  • RQ3샘플링 비용 최소화 또는 원천 선택과 같은 전이 학습의 실용적 의사결정은 분포 매개변수나 불일치 척도를 추정하지 않고도 가능할 수 있는가?
  • RQ4레이블이 부여되지 않은 타겟 샘플은 전이 학습에서 최소최대 최적 성능를 달성하는 데 어떤 역할을 하는가?

주요 결과

  • 최소최대 최적 비율은 상수 요소를 제외하고는 원천 또는 타겟 데이터셋 중 정보량이 더 많은 쪽만을 사용함으로써 달성된다. 이는 둘 다 이용 가능한 경우에도 마찬가지다.
  • 표본 크기 $n_P$ 및 $n_Q$에 대한 최적 비율은 원천과 타겟 간 초과 위험의 불일치를 측정하는 전이 지수 $\rho$에 의해 기술된다.
  • 초과 위험 상한을 최소화하는 데이터 기반 절차는 $\rho$ 또는 $\gamma$를 추정하지 않더라도 최소최대 비율에 도달할 수 있으며, 이는 실용적 구현 가능성을 보장한다.
  • 입력 근사 분포 $P_X$ 및 $Q_X$에 기반한 근사 전이 지수 $\gamma$는 레이블이 부여되지 않은 데이터 및 비용 최소화 시나리오에서 최적의 의사결정을 가능하게 한다.
  • 크기가 $|U_Q| \geq n_P^{\frac{\beta_f}{(2 - \beta_f)\gamma_f}}$인 레이블이 부여되지 않은 타겟 데이터만으로도 최소최대 비율을 달성할 수 있으며, 이는 낮은 샘플링 복잡도를 유지한다.
  • 레이블 노이즈 또는 분포 이탈이 알려지지 않은 상황에서도 방법이 효과를 유지하며, $\gamma$의 추정이 필요하지 않다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.