Skip to main content
QUICK REVIEW

[논문 리뷰] Can Subnetwork Structure be the Key to Out-of-Distribution Generalization?

Dinghuai Zhang, Kartik Ahuja|arXiv (Cornell University)|2021. 06. 05.
Domain Adaptation and Few-Shot Learning참고 문헌 86인용 수 16
한 줄 요약

이 논문은 분포 외 일반화(OOD)에 있어 하위망 구조가 핵심적임을 제안하며, 기능적 로또티켓 가설을 도입한다: 전체 모델 내 하위망이 전체 네트워크보다 더 나은 OOD 성능을 달성할 수 있다. 저자는 이러한 강건한 하위망을 식별하기 위한 구조 학습 방법인 모듈러 리스크 최소화(MRM)를 개발하여, 기존 OOD 정규화 기법들과 호환되면서도 OOD 정확도를 향상시킨다.

ABSTRACT

Can models with particular structure avoid being biased towards spurious correlation in out-of-distribution (OOD) generalization? Peters et al. (2016) provides a positive answer for linear cases. In this paper, we use a functional modular probing method to analyze deep model structures under OOD setting. We demonstrate that even in biased models (which focus on spurious correlation) there still exist unbiased functional subnetworks. Furthermore, we articulate and demonstrate the functional lottery ticket hypothesis: full network contains a subnetwork that can achieve better OOD performance. We then propose Modular Risk Minimization to solve the subnetwork selection problem. Our algorithm learns the subnetwork structure from a given dataset, and can be combined with any other OOD regularization methods. Experiments on various OOD generalization tasks corroborate the effectiveness of our method.

연구 동기 및 목표

  • 모델 구조, 특히 하위망이 허위 상관관계를 완화하고 OOD 일반화를 향상시킬 수 있는지 조사하기.
  • 편향된 전체 모델 내 하위망이 여전히 불변의, 비허위 특징을 포착할 수 있는지 확인하기.
  • 훈련 중에 OOD 데이터에 접근하지 않고도 OOD 성능을 향상시키는 실용적인 하위망 선택 방법 개발하기.
  • 학습된 하위망을 통한 구조적 인도티브 바이어스가 OOD 환경에서 전체 네트워크 용량을 능가할 수 있는지 보여주기.
  • 제안된 방법을 기존 OOD 정규화 기법들과 융합하여 일관된 성능 향상 달성하기.

제안 방법

  • 기능적 로또티켓 가설을 제안한다: 전체 모델 내에서 고립적으로 훈련되었을 때 전체 네트워크보다 더 나은 OOD 성능을 내는 하위망이 존재한다.
  • 모듈러 리스크 최소화(MRM)를 도입한다. 이는 모듈러 구성 요소에 대한 리스크 목표를 최적화하여 하위망 구조를 학습하는 방법이다.
  • MRM는 미분 가능한 희소성 마스크를 사용하여 비불변, 허위 특징을 식별하고 제거하며, 단서 상관관계에 의존하는 모델 부분을 효과적으로 0으로 설정한다.
  • 이 방법은 IRM 등 어떤 OOD 정규화 목표와도 호환되어 기존 접근법과 융합할 수 있다.
  • 구조적 희소성 정규화를 적용하여 종단 간 훈련을 수행함으로써 불변 하위망의 학습을 촉진한다.
  • 하위망은 내분포 및 분포 외 정확도를 통해 평가되며, 전체 모델과 오라클 하위망과의 성능 비교가 이루어진다.

실험 결과

연구 질문

  • RQ1ERM로 훈련된 모델 내 하위망은 전체 모델이 허위 상관관계에 편향되어 있어도 여전히 불변 특징을 포착할 수 있는가?
  • RQ2전체 모델이 편향되어 있어도 분포 이동 조건에서 전체 모델보다 더 잘 일반화하는 하위망이 존재하는가?
  • RQ3MRM와 같은 구조 학습 방법은 훈련 중에 OOD 데이터에 접근하지 않고도 그러한 강건한 하위망을 식별할 수 있는가?
  • RQ4하위망의 구조적 인도티브 바이어스는 전체 모델의 인도티브 바이어스보다 OOD 일반화 측면에서 어떻게 비교되는가?
  • RQ5IRM과 같은 다른 OOD 정규화 방법과 융합했을 때 MRM는 얼마나 성능 향상을 이룰 수 있는가?

주요 결과

  • ERM로 훈련된 허위 상관관계를 악용하는 모델들 내에도 불변이면서 덜 편향된 기능적 하위망이 존재한다.
  • 기능적 로또티켓 가설은 실증적으로 검증되었다: MRM를 통해 선택된 하위망은 FullColoredMNIST에서 전체 네트워크보다 높은 OOD 정확도를 달성한다.
  • MRM는 여러 OOD 벤치마크 작업에서 전체 모델과 표준 기준보다 뚜렷한 OOD 일반화 성능 향상을 보이며, 성능을 개선한다.
  • IRM와 융합했을 때 MRM는 성능을 추가로 향상시키며, 기존 OOD 정규화 기법들과의 호환성과 상호보완성을 입증한다.
  • MRM의 효과성은 다양한 아키텍처와 데이터셋에서 뚜렷하게 유지되며, 성능 향상은 능력 증가가 아닌 구조적 인도티브 바이어스 덕분이다.
  • 하위망 구조의 적절한 희소성 수준이 핵심적이다. 너무 많은 또는 너무 적은 정제는 OOD 성능을 떨어뜨리며, 이는 구조적 학습의 필요성을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.