Skip to main content
QUICK REVIEW

[논문 리뷰] Effects of Loss Functions And Target Representations on Adversarial Robustness

Sean Saito, Sujoy Roy|arXiv (Cornell University)|2018. 12. 01.
Adversarial Robustness in Machine Learning참고 문헌 41인용 수 6
한 줄 요약

이 논문은 표준의 교차 엔트로피와 원핫 인코딩 대신 평균제곱오차(MSE) 손실과 코드워드 기반 타겟 표현을 사용하여 신경망을 훈련시키는 방법을 제안한다. 수정된 모델은 타겟되지 않은 공격에 대해 최대 98.7%의 강건한 정확도를 달성하고, 타겟된 공격의 성공률을 최대 99.8%까지 감소시키며, 상당히 작은 리프시츠 상한을 보이며, 수정 사항을 고려한 공격에 대해서도 향상된 강건성을 보여준다.

ABSTRACT

Understanding and evaluating the robustness of neural networks under adversarial settings is a subject of growing interest. Attacks proposed in the literature usually work with models trained to minimize cross-entropy loss and output softmax probabilities. In this work, we present interesting experimental results that suggest the importance of considering other loss functions and target representations, specifically, (1) training on mean-squared error and (2) representing targets as codewords generated from a random codebook. We evaluate the robustness of neural networks that implement these proposed modifications using existing attacks, showing an increase in accuracy against untargeted attacks of up to 98.7\% and a decrease of targeted attack success rates of up to 99.8\%. Our model demonstrates more robustness compared to its conventional counterpart even against attacks that are tailored to our modifications. Furthermore, we find that the parameters of our modified model have significantly smaller Lipschitz bounds, an important measure correlated with a model's sensitivity to adversarial perturbations.

연구 동기 및 목표

  • 비표준 훈련 목표함수와 타겟 표현 방식이 적대적 강건성에 기여하는지 조사하기 위해
  • 화이트박스 및 전이 공격을 포함한 다양한 공격 시나리오에서의 강건성 평가를 위해
  • 리프시츠 상한을 활용하여 모델 파라미터와 강건성 간의 관계를 분석하기 위해
  • 제안된 수정 사항을 고려한 타겟 공격을 설계하여 모델의 내구성 테스트를 위해

제안 방법

  • 표준 교차 엔트로피와 원핫 타겟 대신, 탄젠트 활성화 출력과 무작위 코드북에서 추출한 코드워드 사이의 평균제곱오차(MSE) 손실을 사용하여 모델을 훈련한다.
  • 클래스 레이블을 나타내기 위해 무작위 코드북 샘플링을 통해 코드워드를 생성하여 원핫 인코딩을 회피한다.
  • 무작위 및 타겟 공격 설정에서 강건성을 평가하기 위해 표준 적대적 공격(FGSM, BIM, MIM, L-BFGS, CWL2)을 적용한다.
  • 새로운 손실과 타겟 표현을 반영한 수정된 CWL2 공격을 설계하여 모델의 내구성을 테스트한다.
  • 컨볼루션 레이어 가중치의 상한 리프시츠 상한을 계산하여 파라미터 민감도와 강건성 간의 상관관계를 분석한다.
  • 다양한 위협 모델 하에서 CIFAR-10, MNIST, Fashion-MNIST 데이터셋에서의 모델 성능을 비교한다.

실험 결과

연구 질문

  • RQ1교차 엔트로피 손실을 평균제곱오차(MSE) 손실로 대체하면 이미지 분류 모델의 적대적 강건성이 향상되는가?
  • RQ2원핫 벡터 대신 무작위 코드워드를 사용하면 적대적 공격에 대한 강건성이 얼마나 향상되는가?
  • RQ3제안된 수정 사항을 고려한 아키텍처 및 훈련 목표에 맞춰 설계된 공격에 대해 수정된 모델은 어떻게 성능을 보이는가?
  • RQ4리프시츠 상한을 통한 스펙트럼 분석은 관찰된 강건성 향상 현상을 설명할 수 있는가?
  • RQ5MSE 손실과 코드워드 타겟의 조합은 전이 기반 블랙박스 공격 하에서도 강건성을 유지하는가?

주요 결과

  • 수정된 모델은 타겟되지 않은 공격에 대해 최대 98.7%의 정확도를 달성하여 기존의 교차 엔트로피 기반 기준 모델보다 뚜렷이 뛰어난 성능을 보였다.
  • 수정된 모델에서 타겟 공격의 성공률은 기존 모델 대비 최대 99.8% 감소하였다.
  • 새로운 손실과 타겟 형식을 반영한 수정된 CWL2 공격을 적용하더라도, 모델은 기준 모델 대비 28.5% 낮은 공격 성공률을 유지하였다.
  • R:TANH:MSE 모델는 100% 공격 성공을 달성하기 위해 상당히 큰 노이즈(예: ε = 0.35)가 필요로 했고, 기존 모델(ε = 0.03)보다 훨씬 더 큰 편향을 요구함으로써 더 높은 강건성을 보였다.
  • MSE로 훈련된 모델의 컨볼루션 레이어 가중치는 교차 엔트로피 모델 대비 상한 리프시츠 상한이 최대 3배까지 작았으며, 이는 노이즈에 대한 민감도 감소 가설을 지지한다.
  • 시각화 결과는 수정된 모델에서의 적대적 예제가 더 눈에 띄지 않으며, 강력한 공격(예: MIM, ε = 0.1) 조건에서도 잘못 분류되기 위해 더 큰 노이즈가 필요하다는 점을 확인하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.