Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Robust Dataset Learning

Yihan Wu, Xinda Li|arXiv (Cornell University)|2022. 11. 19.
Adversarial Robustness in Machine Learning인용 수 7
한 줄 요약

이 논문은 자연적 훈련에서 적대적 방해에 강인한 모델을 얻을 수 있도록 하는 강인한 데이터셋을 학습하기 위해 삼중 최적화 프레임워크를 제안한다. 분류기의 데이터셋에 대한 함수로서의 표현을 통해 청소료 및 강인한 정확도를 동시에 최적화함으로써, AutoAttack 기준 CIFAR10에서 59.52%의 강인한 정확도를 달성하며, 기존 최고 성능인 48.20%를 11.32个百分点 초월한다. 이는 최소한의 계산 비용으로도 빠른 후행 훈련을 가능하게 한다.

ABSTRACT

Adversarial training has been actively studied in recent computer vision research to improve the robustness of models. However, due to the huge computational cost of generating adversarial samples, adversarial training methods are often slow. In this paper, we study the problem of learning a robust dataset such that any classifier naturally trained on the dataset is adversarially robust. Such a dataset benefits the downstream tasks as natural training is much faster than adversarial training, and demonstrates that the desired property of robustness is transferable between models and data. In this work, we propose a principled, tri-level optimization to formulate the robust dataset learning problem. We show that, under an abstraction model that characterizes robust vs. non-robust features, the proposed method provably learns a robust dataset. Extensive experiments on MNIST, CIFAR10, and TinyImageNet demostrate the effectiveness of our algorithm with different network initializations and architectures.

연구 동기 및 목표

  • 자연적 훈련을 통해 적대적 편향에 강인한 모델이 되도록 보장하는 데이터셋을 체계적으로 학습하는 것.
  • 적대적 훈련의 높은 계산 비용을 줄이기 위해 강인성을 모델에서 데이터로 이동시키는 것.
  • 다양한 모델 아키텍처와 가중치 초기화 간에 강인성의 전이성을 가능하게 하는 것.
  • 강건한 특징과 비강건한 특징을 분리하는 특징 추상화 모델에서 강인성에 대한 이론적 보장을 제공하는 것.
  • 작은 크기의 강인한 데이터셋(예: 원본 크기의 10%)이 최소한의 훈련 오버헤드로도 높은 강인한 정확도를 달성할 수 있음을 보여주는 것.

제안 방법

  • 데이터셋을 최적화하여 데이터-파rameter화된 분류기의 강인성을 향상시키는 삼중 최적화 문제로 강인한 데이터셋 학습을 공식화한다.
  • 모델 가중치를 데이터셋에 대한 함수로 매개변수화하여, 강인성 향상을 위한 데이터의 종단 간 최적화를 가능하게 한다.
  • 내부 루프에서 적대적 공격 생성을 사용하여 데이터셋 최적화 과정에서 비강건한 특징을 식별하고 보상 체계를 적용한다.
  • 강건한 특징과 비강건한 특징을 구분하는 이론적 추상화 모델을 도입하여 학습된 데이터셋의 증명 가능 강인성을 입증한다.
  • 청결한 정확도와 강인한 정확도를 동시에 최대화하기 위해 기울기 기반 최적화를 반복적으로 적용하여 데이터셋을 점진적으로 개선한다.
  • 다양한 위협 모델을 고려한 강인성 평가를 위해 AutoAttack 및 기타 적대적 기준을 사용한다.

실험 결과

연구 질문

  • RQ1자연적 훈련을 통해 적대적 편향에 강인한 모델을 생성할 수 있도록 데이터셋을 학습시킬 수 있는가?
  • RQ2학습된 강인성이 다양한 모델 아키텍처와 초기화 방식 간에 전이 가능한가?
  • RQ3원본 크기의 10% 정도로 줄인 데이터셋이 이 방법을 통해 높은 강인한 정확도를 달성할 수 있는가?
  • RQ4제안된 삼중 최적화 프레임워크가 특징 추상화 모델 하에서 강인한 데이터셋을 이론적으로 보장할 수 있는가?
  • RQ5기존의 적대적 데이터 또는 특징 추출 방법을 사용한 베이스라인과 비교해 볼 때, 제안된 강인한 데이터셋의 성능은 어떠한가?

주요 결과

  • 제안된 방법은 AutoAttack 기준 0.25 ℓ₂ 위협 모델에서 CIFAR10에서 59.52%의 강인한 정확도를 달성하여, 이전 최고 성능인 48.20%를 11.32个百分点 초월한다.
  • 0.2 ℓ∞ 위협 모델 기준 MNIST에서는 52.51%의 강인한 정확도를 기록하며, 다양한 랜덤 시드에서의 일반화 성능이 우수함(±0.59 범위 내).
  • 원본 데이터셋 크기의 10%만으로도 CIFAR10에서 42.61%의 강인한 정확도, TinyImageNet에서는 24.38%의 강인한 정확도를 달성하여 확장성과 효율성을 입증한다.
  • 학습된 강인한 데이터셋은 전이성 가능함: 다양한 아키텍처(예: ResNet-34, ResNet-50)와 초기화 방식을 사용해 훈련된 분류기들이 공격에 대해 높은 강인성을 확보한다.
  • 적대적 훈련 기반의 베이스라인(예: 강인한 분류기에서 유도된 적대적 데이터)은 자연적 훈련 시 비강건한 모델을 유도하는 반면, 제안 방법은 이를 초월한다.
  • 간단한 강인한 데이터셋 생성은 A5000 GPU에서 약 2시간이 소요되며, 이를 기반으로 분류기의 미세조정은 10분 이내로 완료되어, 적대적 훈련(1일 이상 소요)에 비해 훨씬 빠르다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.