Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Data Server: A Large-Scale Search Engine for Transfer Learning Data

Xi Yan, David Acuna|arXiv (Cornell University)|2020. 01. 09.
Domain Adaptation and Few-Shot Learning참고 문헌 48인용 수 5
한 줄 요약

Neural Data Server (NDS)는 대규모 공개 이미지 데이터셋을 압축형 믹스처 오브 은사(MoE) 모델을 통해 인덱싱함으로써 전이 학습을 위한 최적의 미리 훈련 데이터를 추천하는 대규모 검색 엔진이다. 이는 클라이언트가 전체 데이터셋 크기의 20%만 사용하여도 최신 기술 수준(SOTA) 성능을 달성할 수 있도록 하며, 전체 이미지 미리 훈련보다 유사하거나 뛰어난 정확도를 보이며 훈련 시간과 계산 비용을 줄인다.

ABSTRACT

Transfer learning has proven to be a successful technique to train deep learning models in the domains where little training data is available. The dominant approach is to pretrain a model on a large generic dataset such as ImageNet and finetune its weights on the target domain. However, in the new era of an ever-increasing number of massive datasets, selecting the relevant data for pretraining is a critical issue. We introduce Neural Data Server (NDS), a large-scale search engine for finding the most useful transfer learning data to the target domain. NDS consists of a dataserver which indexes several large popular image datasets, and aims to recommend data to a client, an end-user with a target application with its own small labeled dataset. The dataserver represents large datasets with a much more compact mixture-of-experts model, and employs it to perform data search in a series of dataserver-client transactions at a low computational cost. We show the effectiveness of NDS in various transfer learning scenarios, demonstrating state-of-the-art performance on several target datasets and tasks such as image classification, object detection and instance segmentation. Neural Data Server is available as a web-service at http://aidemos.cs.toronto.edu/nds/.

연구 동기 및 목표

  • 전이 학습에서 끊임없이 증가하는 대규모 공개 데이터셋 중에서 가장 관련성이 높은 미리 훈련 데이터를 선택하는 데 있어 핵심 과제를 해결한다.
  • 효율적이고 데이터 효율적인 높은 유용성의 샘플 선택을 통해 대규모 데이터셋에서의 미리 훈련에 따른 계산 및 재정적 부담을 줄인다.
  • 클라이언트의 데이터가 추천 과정 중에 서버에 노출되지 않도록 함으로써 클라이언트의 프라이버시를 보호한다.
  • 서버에서의 온라인 계산을 최소화하여 다수의 클라이언트가 동시에 병렬로 서비스를 이용할 수 있도록 고성능, 확장 가능한 서비스를 지원한다.
  • 자체 레이블이 없는 경우나 레이블이 없는 상황에서도 선택된 데이터를 기반으로 자기지도 학습을 활용함으로써 저자원 환경에서도 효과적인 전이 학습을 가능하게 한다.

제안 방법

  • 다양한 대규모 공개 이미지 데이터셋(COCO, OpenImages 등)을 압축형 믹스처 오브 은사(MoE) 모델을 사용해 인덱싱하여 데이터 분포 패턴을 포착한다.
  • 인덱싱된 데이터셋에서 MoE 모델을 훈련시켜 다양한 시각적 개념에 대해 전담 전문가 특성 표현을 학습한다.
  • 클라이언트의 소규모 레이블이 있는 타겟 데이터셋을 사용하여 각 전문가의 정확도를 타겟 작업에서 평가하고, 이는 데이터 유용성의 대체 지표로 활용한다.
  • 클라이언트의 데이터에서 전문가 성능을 기반으로 서버의 인덱싱된 데이터셋에서 샘플을 순위 매기고, 높은 유용성의 예측 샘플을 우선 추천한다.
  • 예비 과제(예: 인스턴스 식별, 회전 예측 등)에 적응시킨 MoE 모델을 활용해 지도 학습 및 자기지도 학습 모두를 지원한다.
  • 공개적으로 이용 가능한 데이터에 대한 링크로 추천을 제공함으로써 데이터 호스팅을 피하고 라이선스 및 프라이버시 제약사항을 준수한다.

실험 결과

연구 질문

  • RQ1확장 가능하고 프라이버시를 보장하는 검색 엔진은 주어진 타겟 도메인에 대해 가장 유용한 미리 훈련 데이터를 효과적으로 식별할 수 있는가?
  • RQ2압축형 MoE 모델이 대규모 데이터셋을 정확하게 표현하고 전이 학습을 위한 데이터 선택을 이끌 수 있는가?
  • RQ3작은 유용성 높은 데이터 하위집합(예: 20%)을 선택할 경우, 무작위 샘플링이나 전체 데이터셋 미리 훈련보다 더 높은 최종 성능을 달성할 수 있는가?
  • RQ4다양한 최종 작업에서 NDS의 성능은 표준 ImageNet 미리 훈련과 비교해 정확도 및 효율성 측면에서 어떻게 다른가?
  • RQ5NDS 프레임워크는 자기지도 학습 파라다임으로 일반화될 수 있으며, 예비 과제의 선택이 데이터 선택 효과성에 어떤 영향을 미치는가?

주요 결과

  • NDS는 전체 데이터셋 크기의 20%만 사용하여 이미지 분류, 객체 검출, 인스턴스 세그멘테이션 작업에서 최신 기술 수준(SOTA) 성능을 달성한다.
  • Cityscapes 데이터셋에서 NDS가 선택한 미리 훈련 데이터는 23,000장의 이미지로 마스크 AP 54.62%를 기록했으며, 균일 샘플링(54.01%)을 뛰어나고 전체 데이터셋 미리 훈련 결과와 유사한 성능을 내며 훨씬 낮은 데이터 볼륨을 사용했다.
  • RotNet을 사용한 자기지도 학습에서 NDS가 선택한 데이터는 균일 샘플링(72.59%)보다 0.31% 높은 성능(72.85%)을 기록하여 대조 학습 환경에서도 효과적임을 입증했다.
  • MoCo 미리 훈련에서 NDS가 선택한 데이터는 Oxford-IIIT Pets에서 상위-1 정확도 61.49%를 기록했으며, 균일 샘플링(60.25%)을 뛰어나고 전체 데이터셋 성능(67.54%)에 근접했다.
  • 전체 미리 훈련 데이터량을 538GB에서 단 26GB로 줄였고, 전체 데이터셋 미리 훈련과 비교해 더 높거나 유사한 성능을 달성하여 훈련 시간을 주에서 일로 단축시켰다.
  • 이 방법은 제로샷 및 자기지도 학습 환경으로도 일반화되며, 클라이언트가 레이블이 없는 경우에도 MoE 모델의 예비 과제 성능을 활용해 일관된 성능 향상을 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.