Skip to main content
QUICK REVIEW

[논문 리뷰] Model Ratatouille: Recycling Diverse Models for Out-of-Distribution Generalization

Alexandre Ramé, Kartik Ahuja|arXiv (Cornell University)|2022. 12. 20.
Domain Adaptation and Few-Shot Learning인용 수 5
한 줄 요약

이 논문은 기초 모델의 다양한 미세조정된 모델을 재활용함으로써 분포 외(OOD) 일반화를 향상시키는 Model Ratatouille 방법을 제안한다. 기초 모델의 보조 미세조정 모델의 가중치를 사용해 대상 작업에 대해 다중 병렬 미세조정을 초기화한 후, 이를 평균화함으로써 추가 추론 또는 학습 비용 없이 DomainBed에서 최신 기술 수준(SoTA) 성능을 달성한다.

ABSTRACT

Foundation models are redefining how AI systems are built. Practitioners now follow a standard procedure to build their machine learning solutions: from a pre-trained foundation model, they fine-tune the weights on the target task of interest. So, the Internet is swarmed by a handful of foundation models fine-tuned on many diverse tasks: these individual fine-tunings exist in isolation without benefiting from each other. In our opinion, this is a missed opportunity, as these specialized models contain rich and diverse features. In this paper, we thus propose model ratatouille, a new strategy to recycle the multiple fine-tunings of the same foundation model on diverse auxiliary tasks. Specifically, we repurpose these auxiliary weights as initializations for multiple parallel fine-tunings on the target task; then, we average all fine-tuned weights to obtain the final model. This recycling strategy aims at maximizing the diversity in weights by leveraging the diversity in auxiliary tasks. Empirically, it improves the state of the art on the reference DomainBed benchmark for out-of-distribution generalization. Looking forward, this work contributes to the emerging paradigm of updatable machine learning where, akin to open-source software development, the community collaborates to reliably update machine learning models. Our code is released: https://github.com/facebookresearch/ModelRatatouille.

연구 동기 및 목표

  • 각 모델이 별도로 학습되어 다른 미세조정된 변형의 지식을 활용하지 못하는 고립된 미세조정 방식의 한계를 해결한다.
  • 보조 작업에서 학습된 다수의 미세조정된 모델이 학습한 특징의 다양성을 활용하여 분포 외(OOD) 일반화에 대한 강건성을 향상시킨다.
  • 기존에 미세조정된 모델들을 대상 작업의 미세조정 초기화 포인트로 재사용하는 전략을 개발하여 모델 다양성을 극대화한다.
  • 표준 하이퍼파라미터 검색과 비교해 추가 추론 또는 학습 오버헤드 없이 최신 기술 수준의 OOD 일반화 성능을 달성한다.
  • 모델이 공동으로 개선되는 공동 기여 방식의 업데이트 가능한 기계학습 패러다임, 즉 오픈소스 소프트웨어와 유사한 분위기에 기여한다.

제안 방법

  • 기초 모델의 사전에 존재하는 여러 미세조정된 모델—다양한 보조 작업에서 학습된 것들—을 대상 작업의 미세조정 초기화 가중치로 재사용한다.
  • 각 보조 미세조정 모델을 시작점으로 삼아 기초 모델을 대상 작업에서 독립적으로 미세조정한다.
  • 모든 대상 작업 미세조정의 최종 가중치를 평균하여 최종 모델을 구성한다.
  • 균일 선택 및 근사 선택 전략을 사용해 보조 모델을 선택하고, 성능에 미치는 영향을 평가한다.
  • 다중 미세조정을 병렬로 수행함으로써 계산 효율성을 확보하고, 추가 추론 비용 없이 구현한다.
  • OOD 일반화 성능 평가를 위해 DomainBed, DomainNet, Camelyon과 같은 표준 벤치마크를 활용한다.

실험 결과

연구 질문

  • RQ1기초 모델의 다양한 미세조정된 모델을 초기화 포인트로 재활용하면 대상 작업에서 분포 외(OOD) 일반화가 향상되는가?
  • RQ2보조 작업의 다양성이 OOD 환경에서 최종 평균 모델의 성능에 어떤 영향을 미치는가?
  • RQ3Model Ratatouille는 기존 앙상블 및 평균 전략(예: 모델 수프, DiWA)보다 OOD 일반화 벤치마크에서 승리하는가?
  • RQ4의료 영상(예: Camelyon)과 세밀한 시각 인식(예: TerraIncognita)을 포함한 다양한 데이터셋에 대해 이 방법이 효과적으로 적용될 수 있는가?
  • RQ5보조 작업이 대상 작업과 다를 경우 성능 향상이 유지되는가, 아니면 보조 작업이 관련성이 높을 때 가장 유리한가?

주요 결과

  • Model Ratatouille는 DomainBed 벤치마크에서 분포 외(OOD) 일반화 성능이 최신 기술 수준(SoTA)에 도달했으며, 모든 데이터셋 평균 정확도 68.1%를 기록해 이전 방법들인 모델 수프 및 DiWA를 초월했다.
  • DomainNet에서 Model Ratatouille는 균일 선택 시 평균 정확도 47.7%를 기록했고, 근사 선택 시에도 동일한 47.7%를 달성하여 모델 수프 및 DiWA의 성능을 매칭하거나 초월했다.
  • Camelyon 히스토파스절 영상 데이터셋에서 Model Ratatouille는 모델 수프보다 OOD 일반화 성능을 향상시켜 근사 선택 기준 평균 정확도 95.4%를 기록했다(수프 대비 95.1%).
  • 이 방법은 보조 작업 선택에 대해 강건성을 보였다: 거리가 먼 보조 작업(예: DomainBed에서 TerraIncognita로의 적용)을 사용할 경우, 모델 수프의 51.4%에서 Model Ratatouille는 51.8%로 성능 향상을 보였다.
  • TerraIncognita에서 더 관련성이 높은 보조 작업(iWildCam)을 사용할 경우 Model Ratatouille는 평균 정확도 52.9%를 기록해 관련 보조 지식을 효과적으로 활용할 수 있음을 보여주었다.
  • 표준 하이퍼파라미터 검색과 비교해 추가 추론 또는 학습 오버헤드 없이 구현되어 실세계 적용에 실용적이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.