Skip to main content
QUICK REVIEW

[논문 리뷰] Learning Representations that Support Robust Transfer of Predictors

Yilun Xu, Tommi Jaakkola|arXiv (Cornell University)|2021. 10. 19.
Domain Adaptation and Few-Shot Learning참고 문헌 38인용 수 4
한 줄 요약

이 논문은 새로운 강건한 추정 기준인 전이 위험 최소화(Transfer Risk Minimization, TRM)를 제안한다. 이는 미사용 환경 간 예측기의 전이 가능성 향상을 위해 표현 학습을 최적화한다. 최적의 각 환경별 예측기를 다른 환경에 적용할 때의 위험을 최소화함으로써 TRM는 직접 전이 항과 가중된 기울기 일치 항으로 분해되며, PACS 및 Office-Home와 같은 제어된 및 실제 세계 데이터셋에서 분포 외 일반화 성능에서 IRM 및 기준선을 능가한다.

ABSTRACT

Ensuring generalization to unseen environments remains a challenge. Domain shift can lead to substantially degraded performance unless shifts are well-exercised within the available training environments. We introduce a simple robust estimation criterion -- transfer risk -- that is specifically geared towards optimizing transfer to new environments. Effectively, the criterion amounts to finding a representation that minimizes the risk of applying any optimal predictor trained on one environment to another. The transfer risk essentially decomposes into two terms, a direct transfer term and a weighted gradient-matching term arising from the optimality of per-environment predictors. Although inspired by IRM, we show that transfer risk serves as a better out-of-distribution generalization criterion, both theoretically and empirically. We further demonstrate the impact of optimizing such transfer risk on two controlled settings, each representing a different pattern of environment shift, as well as on two real-world datasets. Experimentally, the approach outperforms baselines across various out-of-distribution generalization tasks. Code is available at \url{https://github.com/Newbeeer/TRM}.

연구 동기 및 목표

  • 환경 간 이질성에 의해 표준 ERM가 허위의, 환경에 특화된 특징으로 인해 실패하는 분포 외 일반화 문제를 해결하기 위해.
  • 미사용 환경으로의 예측기의 강건한 전이를 직접 최적화하는 학습 목표를 개발하기 위해.
  • 비선형 설정에서의 일반화를 더 잘 지원하는 기준을 제안함으로써 기존의 불변성 기반 방법(예: IRM)을 향상시키기 위해.
  • 제어된 이질성 패턴과 실제 세계 벤치마크에서의 성능 평가를 통해 허위 특징에 대한 강건성을 입증하기 위해.

제안 방법

  • 한 환경에서 학습된 최적의 예측기를 다른 적대적으로 선택된 환경에 적용할 때의 평균 위험을 측정하는 기준인 전이 위험 최소화(TRM)를 제안한다.
  • 전이 위험를 두 구성요소로 분해한다: 직접 전이 항과 각 환경 간 예측기 일관성을 촉진하는 가중된 기울기 일치 항.
  • TRM 기준 하에 표현 학습과 각 환경별 예측기 학습을 동시에 수행하는 교차 최적화 알고리즘을 개발한다.
  • 두 단계 학습 프로세스를 적용한다: 먼저 각 환경의 예측기를 최적화한 후, 전이 위험를 최소화하도록 표현을 업데이트한다.
  • 표준 백본(예: ResNet18 및 ResNet50)을 사용하여 제어된 데이터셋(10C-CMNIST, SceneCOCO)과 실제 세계 벤치마크(PACS, Office-Home)에 적용한다.
  • 그룹 분포로 보존된 강건성과 결합하여 TRM를 그룹 분포로 보존된 강건성에 적응시켜, 허위 상관관계가 존재할 경우에도 불변 특징 학습을 유지한다.

실험 결과

연구 질문

  • RQ1미사용 환경 간 예측기의 강건한 전이를 직접 최적화할 수 있는 표현 학습 목표를 설계할 수 있는가?
  • RQ2TRM는 분포 외 일반화 성능 측면에서 IRM 및 기타 불변성 기반 방법과 비교해 어떻게 성능을 냈는가?
  • RQ3TRM는 훈련 데이터 내 허위의, 환경에 특화된 특징의 부정적 영향을 효과적으로 완화하는가?
  • RQ4TRM는 제어된 이질성 설정과 실제 세계 도메인 일반화 벤치마크 양쪽 모두에서 잘 일반화되는가?

주요 결과

  • ResNet50를 사용한 PACS 데이터셋에서 TRM는 평균 정확도 82.9%와 악성 그룹 정확도 70.9%를 기록하여 ERM, IRM 및 GroupDRO를 모두 능가한다.
  • Office-Home 데이터셋에서 TRM는 평균 정확도 65.5%를 기록하여 ERM(64.1%), IRM(64.3%), REx(64.8%)를 모두 능가하며, 악성 그룹에서도 뛰어난 성능을 보였다.
  • CelebA 그룹 분포로 보존된 강건성 실험에서 TRM는 악성 그룹 정확도 90.3%를 기록하여 GroupDRO(90.0%)와 Reweight(89.3%)를 초월했으며, 높은 평균 정확도를 유지했다.
  • 10C-CMNIST 및 SceneCOCO 제어된 설정에서 비인과적 특징이 존재할 경우 TRM는 기준선 대비 뛰어난 강건성을 보이며, 분포 외 일반화 성능에서 승리했다.
  • TRM의 에포크당 학습 시간은 8.69초로 ERM(5.81초)보다 다소 높지만, 기울기 일치를 위한 추가 계산이 있음에도 불구하고 효율적인 최적화를 보였다.
  • 제거 실험 결과, 비선형 특징 변환 상황에서 특히 중요하게 작용하는 가중된 기울기 일치 항이 강건성에 필수적임을 확인했다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.