Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Sampling Policies for Domain Adaptation

Yash Patel, Kashyap Chitta|arXiv (Cornell University)|2018. 05. 19.
Domain Adaptation and Few-Shot Learning참고 문헌 16인용 수 6
한 줄 요약

이 논문은 소스 분류기에서 생성한 노이즈 있는 레이블을 사용하여 타겟 데이터에 대해 샘플링 정책을 학습하기 위해 딥 Q-러닝 접근법을 제안한다. 작은 레이블된 보상 세트에서 정확도를 최대화하는 정보성 있는 샘플을 선택하기 위해 에이전트를 훈련시킨다. 이 방법은 Office-31에서 준지도 학습 접근법 중 최고 성능을 기록하며, 베이스라인을 능가하고 비지도 SOTA에 가까워지지만, 고정된 최적화되지 않은 표현으로 인해 성능에 한계가 있다.

ABSTRACT

We address the problem of semi-supervised domain adaptation of classification algorithms through deep Q-learning. The core idea is to consider the predictions of a source domain network on target domain data as noisy labels, and learn a policy to sample from this data so as to maximize classification accuracy on a small annotated reward partition of the target domain. Our experiments show that learned sampling policies construct labeled sets that improve accuracies of visual classifiers over baselines.

연구 동기 및 목표

  • 타겟 도메인의 소량의 레이블된 보상 세트를 활용하여 도메인 적응에서 높은 레이블링 비용 문제를 해결하고자 한다.
  • 타겟 데이터에 대한 최적의 샘플링 정책을 학습시켜 준지도 학습 도메인 적응에서 분류 정확도를 향상시키고자 한다.
  • 사전 훈련된 소스 분류기의 지식을 강화 학습 에이전트와 통합하여 정보성 있는 타겟 샘플을 능동적으로 선택하는 데 목적이 있다.
  • 정책 기반 샘플링이 자원이 제한된 도메인 적응 환경에서 무작위 또는 히우리스틱 샘플링보다 우월한가를 탐색하고자 한다.
  • Office-31 벤치마크에서 비지도 및 준지도 베이스라인과의 성능 비교를 통해 방법의 성능을 평가하고자 한다.

제안 방법

  • 소스 도메인에서 훈련된 ResNet-50 백본을 미세조정하여 타겟 도메인 이미지에 대해 가짜 레이블을 생성하는 소스 분류기 $C_{src}$를 생성한다.
  • 소스와 타겟 특징를 구분하는 이진 SVM 도메인 식별기 $C_{dom}$을 훈련하고, 결정 경계에서의 거리 기반으로 보상 세트 $S_{rew}$를 샘플링하는 데 사용한다.
  • 딥 Q-네트워크(DDQN)가 샘플링 정책으로 작동하여 타겟 이미지를 다수의 학습 세트 $S_{pos}$에 추가하기 위해 선택한다. 이는 다중 클래스 SVM 타겟 분류기 $C_{tar}$를 위한 것이다.
  • Q-에이전트는 $S_{rew}$에서 $C_{tar}$의 정확도에 기반한 희박한 보상으로 훈련되며, 각 동작 후 $S_{pos}$를 재학습시킨다.
  • 상태 표현은 예측 신뢰도 히스토그램과 후보 특징을 포함하며, 각 반복에서 21개의 이미지에 대한 행동 공간을 가진다.
  • Q-네트워크는 Adam 옵티마이저, $\u0000$-그리디 탐색, 20,000 반복 동안 매 10단계마다 타겟 네트워크 업데이트를 통해 훈련된다.

실험 결과

연구 질문

  • RQ1강화 학습 에이전트가 인간이 레이블링한 데이터를 최소한으로 사용하면서도 정보성 있는 타겟 도메인 이미지를 선택하여 분류기 정확도를 향상시킬 수 있는가?
  • RQ2준지도 학습 도메인 적응에서 정책 기반 샘플링은 무작위 또는 히우리스틱 샘플링보다 어떻게 비교되는가?
  • RQ3사전 훈련된 소스 분류기에서 유도한 가짜 레이블을 활성 샘플링과 결합할 때, 후속 성능 향상에 얼마나 기여하는가?
  • RQ4고정된 소스 분류기와 보상 기반 강화 학습 에이전트를 통합하면 비지도 도메인 적응 방법보다 더 좋은 성능을 낼 수 있는가?
  • RQ5표현 품질이 학습된 샘플링 정책의 성능에 미치는 영향은 어느 정도인가?

주요 결과

  • 제안된 방법은 A→D에서 86.1%, A→W에서 83.5%, D→A에서 64.6%, D→W에서 93.1%, W→A에서 60.8%, W→D에서 98.2%의 정확도를 기록하여 모든 전이 작업에서 베이스라인을 능가한다.
  • 모든 여섯 개인 Office-31 전이 작업에서 베이스라인(76.9%에서 96.8%)을 초월하여 활성 샘플링의 일관된 성과 향상을 입증한다.
  • 사전 훈련된 소스 분류기에서 유도한 고정된 표현을 사용하고 있음에도 불구하고, Kang 등(2019)과 같은 비지도 SOTA 도메인 적응 방법과의 격차를 상당 부분 줄였다.
  • 도메인 식별기 신뢰도 기반으로 샘플링된 보상 세트 $S_{rew}$는 정책 성능 평가에 효과적으로 기여하며 Q-에이전트가 고품질 샘플로 향하도록 이끈다.
  • DDQN 기반 샘플링 정책은 다양한 도메인 간에 일반화되며, 특히 클래스당 레이블이 3개뿐인 자원이 제한된 환경에서 일관된 향상을 이룬다.
  • 강화 학습을 통한 활성 학습과 소스 도메인 지식의 융합이 단독으로 사용할 경우보다 더 높은 성능을 낼 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.