[논문 리뷰] Adversarial Training with Complementary Labels: On the Benefit of Gradually Informative Attacks
이 논문은 샘플이 속하지 않는 클래스를 나타내는 보완 레이블(CL)을 사용하는 새로운 적대적 훈련 프레임워크를 제안한다. 모델은 보완 레이블을 사용해 훈련되며, 보완 레이블을 활용한 적대적 훈련에서 최상의 성능을 달성한다. 이는 일반 레이블을 사용한 표준 AT에 가까운 성능을 보이며, CIFAR10 및 Kuzushiji 데이터셋에서 뛰어난 강건성 정확도를 달성한다.
Adversarial training (AT) with imperfect supervision is significant but receives limited attention. To push AT towards more practical scenarios, we explore a brand new yet challenging setting, i.e., AT with complementary labels (CLs), which specify a class that a data sample does not belong to. However, the direct combination of AT with existing methods for CLs results in consistent failure, but not on a simple baseline of two-stage training. In this paper, we further explore the phenomenon and identify the underlying challenges of AT with CLs as intractable adversarial optimization and low-quality adversarial examples. To address the above problems, we propose a new learning strategy using gradually informative attacks, which consists of two critical components: 1) Warm-up Attack (Warm-up) gently raises the adversarial perturbation budgets to ease the adversarial optimization with CLs; 2) Pseudo-Label Attack (PLA) incorporates the progressively informative model predictions into a corrected complementary loss. Extensive experiments are conducted to demonstrate the effectiveness of our method on a range of benchmarked datasets. The code is publicly available at: https://github.com/RoyalSkye/ATCL.
연구 동기 및 목표
- 부정확한 감독 정보를 가진 실용적이지만 연구가 부족한 설정인 보완 레이블(CL)을 사용한 적대적 훈련의 과제를 해결하기 위해.
- CL을 사용한 AT에서의 핵심 문제인 비가역적인 적대적 최적화와 저품질의 적대적 예제를 규명하고 해결하기 위해.
- 훈련 중에 일반 레이블이 아닌 CL만 제공될 때 효과적인 적대적 강건성을 달성할 수 있는 새로운 학습 전략을 개발하기 위해.
- 보완 레이블을 사용한 적대적 훈련과 일반 레이블을 사용한 표준 적대적 훈련 간의 성능 격차를 줄이기 위해.
제안 방법
- 초기 훈련 단계에서 점진적으로 증가하는 노이즈 예산을 사용하는 Warm-up Attack을 도입하여 CL을 사용한 적대적 최적화의 안정성을 높인다.
- 진행적으로 정교해지는 모델 예측을 보완 손실에 통합하는 Pseudo-Label Attack(PLA)을 제안하여 더 정보적인 공격을 가능하게 한다.
- 두 단계 훈련 전략을 사용한다: 먼저 보완 손실을 사용해 CL로 사전 훈련한 후, PLA로 생성된 적대적 예제를 사용해 미세조정한다.
- 충분한 데이터 하에서 보완 위험과 일반 위험 간 통계적 일관성을 확보하기 위해 역방향 보정 손실 함수를 사용한다.
- 시간이 지남에 따라 공격의 정보성과 향상되는 훈련 스케줄을 설계하여 최적화 안정성과 적대적 예제 품질을 모두 향상시킨다.
- 동적 노이즈 예산과 모델 예측을 활용한 PGD 기반 적대적 공격을 사용하여 CL 감독 하에서 고품질의 적대적 예제를 생성한다.
실험 결과
연구 질문
- RQ1표준 지도 학습에서 성공함에도 불구하고, 왜 적대적 훈련과 보완 레이블 학습을 직접 조합하면 실패하는가?
- RQ2왜 보완 레이블을 사용한 적대적 훈련에서 안정성과 성능이 떨어지는가?
- RQ3오직 보완 레이블만을 사용할 때 어떻게 적대적 최적화를 안정화할 수 있는가?
- RQ4보완 감독 하에서 생성된 적대적 예제를 고품질이자 정보적인 것으로 만들 수 있는가?
- RQ5보완 레이블을 사용한 적대적 강건성은 일반 레이블을 사용한 표준 적대적 훈련 수준에 얼마나 가까이 다가설 수 있는가?
주요 결과
- 제안된 방법인 Warm-up+PLA는 Kuzushiji에서 PGD20 테스트 정확도 90.50%를 달성하여 베이스라인 및 모든 다른 방법보다 뛰어난 성능을 보였다.
- CIFAR10에서 이 방법은 PGD20 정확도 54.58%를 기록하여 일반 레이블이 없는 상황에서도 강력한 강건성을 입증했다.
- 두 단계 베이스라인은 SVHN에서 오라클 표준 AT를 초월하는 성능을 보였으며, 이는 적대적 훈련에서 노이즈가 있거나 부정확한 감독 정보가 유리할 수 있음을 시사한다.
- 제거 실험을 통해 Warm-up Attack과 Pseudo-Label Attack이 모두 필수적임을 확인했다. 특히 복잡한 데이터셋에서 둘 중 하나를 제거하면 성능이 떨어진다.
- 초기화 파라미터 $E_{\mathrm{s}}$의 넓은 범위에서 안정적인 성능을 보이며 하이퍼파라미터 튜닝에 뛰어난 내성성을 보였다.
- 실증 분석을 통해 제안된 방법이 기울기 소실을 완화하고 기울기 분산을 감소시켜 CL을 사용한 훈련의 안정성을 높임을 확인했다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.