Skip to main content
QUICK REVIEW

[논문 리뷰] MixUp as Directional Adversarial Training

Guillaume Archambault, Yongyi Mao|arXiv (Cornell University)|2019. 06. 17.
Adversarial Robustness in Machine Learning참고 문헌 17인용 수 16
한 줄 요약

이 논문은 MixUp가 방향성 적으로 훈련되는 새로운 형태의 적대적 훈련, 즉 방향적 적대적 훈련(DAT)과 동치임을 밝혀낸다. 여기서 예시는 원래 레이블을 유지하면서 다른 예시 쪽으로 편향된다. 이 논문은 표준 MixUp의 일반화된 버전인 Untied MixUp를 제안하며, 이는 DAT 방법의 전체 클래스와 동치이다. 실험적으로 일부 Untied MixUp 변형이 CIFAR-100에서 표준 MixUp를 능가함을 입증하여, 더 뛰어난 정규화 능력을 지닌다는 것을 확인한다.

ABSTRACT

In this work, we explain the working mechanism of MixUp in terms of adversarial training. We introduce a new class of adversarial training schemes, which we refer to as directional adversarial training, or DAT. In a nutshell, a DAT scheme perturbs a training example in the direction of another example but keeps its original label as the training target. We prove that MixUp is equivalent to a special subclass of DAT, in that it has the same expected loss function and corresponds to the same optimization problem asymptotically. This understanding not only serves to explain the effectiveness of MixUp, but also reveals a more general family of MixUp schemes, which we call Untied MixUp. We prove that the family of Untied MixUp schemes is equivalent to the entire class of DAT schemes. We establish empirically the existence of Untied Mixup schemes which improve upon MixUp.

연구 동기 및 목표

  • 표준 MixUp의 근본적 메커니즘을 적대적 훈련과 연결함으로써 이해하기 위해.
  • 표준 MixUp의 한계를 규명하고 더 효과적인 정규화 기법을 탐색하기 위해.
  • 표준 수식을 초월하는 MixUp의 일반화된 형태인 Untied MixUp를 제안하기 위해.
  • Untied MixUp이 표준 MixUp보다 성능 면에서 뛰어나다는 것을 실험적으로 평가하기 위해.
  • 표준 교차 엔트로피 손실을 넘어서 타겟 선형 손실 함수를 사용하는 모델로 MixUp를 일반화하기 위해.

제안 방법

  • 훈련 예시가 다른 예시 쪽으로 거리의 (1−λ) 비율만큼 편향되며, 원래 레이블을 타겟으로 사용하는 방향적 적대적 훈련(DAT)을 도입한다.
  • 표준 MixUp가 기대 손실과 渐近 최적화 측면에서 DAT의 특정 부분집합과 수학적으로 동치임을 증명한다.
  • 입력과 레이블에 대한 혼합 계수를 서로 다른 베타 분포에서 독립적으로 샘플링함으로써, MixUp의 일반화된 형태인 Untied MixUp을 제안한다.
  • DAT 기법의 전체 가족이 Untied MixUp 기법의 전체 가족과 동치임을 입증한다.
  • 고성능 구성 요소를 찾기 위해 Untied MixUp 정책 공간 (α, β) 에서의 수단적 히우리스틱 탐색을 수행한다.
  • 기울기의 확률적 변동성을 줄이기 위해, 각 샘플에 대해 독립적인 λ 샘플링과 각 에포크에 두 개의 셔플된 데이터 복제본을 사용하는 개선된 훈련 절차를 구현한다.

실험 결과

연구 질문

  • RQ1MixUp는 근본적으로 적대적 훈련의 한 형태와 동치이며, 그 정확한 동치성의 성격은 무엇인가?
  • RQ2표준 MixUp의 현재 수식을 초월하여 일반화할 수 있는 더 넓은 적대적 훈련 기법의 클래스는 무엇인가?
  • RQ3일반화된 형태의 MixUp인 Untied MixUp이 표준 MixUp보다 더 나은 일반화 성능을 달성할 수 있는가?
  • RQ4제안된 MixUp의 일반화가 교차 엔트로피 손실 함수 외의 손실 함수를 사용하는 모델로도 확장될 수 있는가?
  • RQ5특히 도전적인 데이터셋에서 Untied MixUp이 실질적으로 표준 MixUp를 능가할 수 있는가?

주요 결과

  • Untied MixUp는 전체 방향적 적대적 훈련(DAT) 기법의 클래스와 수학적으로 동치이다.
  • CIFAR-100에서 가장 우수한 성능을 보인 Untied MixUp 정책(B(1.4,0.7))은 테스트 오차율 21.863%를 기록했으며, 표준 MixUp 정책(B(0.9,0.9))의 21.942%보다 뛰어나다.
  • CIFAR-10에서는 Untied MixUp이 더 작은 차이이지만 일관된 개선을 보였으며, 평균 오차율은 MixUp의 4.172% 대비 Untied MixUp의 4.175%였다.
  • 비교적 교차 엔트로피 손실 외의 손실 함수(예: NC 손실)를 사용하는 모델로의 MixUp 일반화가 실험적으로 검증되었으며, MixUp와 Untied MixUp 모두 효과적인 것으로 나타났다.
  • 개선된 훈련 절차(독립적인 λ 샘플링, 각 에포크에 두 개의 셔플된 데이터 복제본)는 더 매끄러운 훈련을 이끌었지만, 주요 기여는 이론적 및 방법론적 프레임워크에 있다.
  • 결과적으로 현재의 MixUp 및 Untied MixUp 설계가 최적화되지 않았음을 시사하며, 향후 연구는 각 훈련 쌍에 대해 개별화된 혼합 정책을 탐색해야 할 것이다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.