Skip to main content
QUICK REVIEW

[논문 리뷰] Investigating Decision Boundaries of Trained Neural Networks

Roozbeh Yousefzadeh, Dianne P. O’Leary|arXiv (Cornell University)|2019. 08. 07.
Adversarial Robustness in Machine Learning참고 문헌 22인용 수 7
한 줄 요약

이 논문은 훈련된 신경망의 결정 경계 상의 정확한 플립 포인트—즉, 모델의 예측이 바뀌는 지점—를 계산하여 가장 가까운 적대적 편향을 정확히 측정하고 모델의 강건성을 평가한다. 비볼록 최적화 문제를 해결하여 가장 가까운 플립 포인트를 찾는 방법은 모델의 진정된 가장 약한 취약점을 드러내며, 거리 제약을 가진 적대적 공격 방법이 실패하거나 최소 편향을 놓칠 수 있음을 고려할 때 이를 뛰어넘는다.

ABSTRACT

Deep learning models have been the subject of study from various perspectives, for example, their training process, interpretation, generalization error, robustness to adversarial attacks, etc. A trained model is defined by its decision boundaries, and therefore, many of the studies about deep learning models speculate about the decision boundaries, and sometimes make simplifying assumptions about them. So far, finding exact points on the decision boundaries of trained deep models has been considered an intractable problem. Here, we compute exact points on the decision boundaries of these models and provide mathematical tools to investigate the surfaces that define the decision boundaries. Through numerical results, we confirm that some of the speculations about the decision boundaries are accurate, some of the computational methods can be improved, and some of the simplifying assumptions may be unreliable, for models with nonlinear activation functions. We advocate for verification of simplifying assumptions and approximation methods, wherever they are used. Finally, we demonstrate that the computational practices used for finding adversarial examples can be improved and computing the closest point on the decision boundary reveals the weakest vulnerability of a model against adversarial attack.

연구 동기 및 목표

  • 비선형 활성화를 가진 딥 신경망에서 결정 경계 상의 정확한 점을 계산하는 것이 비현실적이라는 문제를 다루기 위해.
  • 선형 근사나 간접적인 거리 추정에 의존하는 해석 가능성, 일반화 오차, 적대적 강건성 연구에서 흔히 쓰이는 단순화된 가정들을 도전하기 위해.
  • 정확한 플립 포인트 계산을 통해 가장 가까운 적대적 예제를 직접이고 계산적으로 실현 가능한 방법으로 식별하기 위해.
  • 현재 사용하는 거리 제약을 가진 적대적 공격 방법이 최소 편향을 놓칠 수 있으며, 이는 강건성 평가를 약화시킬 수 있음을 입증하기 위해.

제안 방법

  • 원본 데이터 포인트와 결정 경계 상의 점 사이의 유클리드 거리를 최소화하는 비볼록 최적화 문제로 가장 가까운 플립 포인트를 찾는 문제를 수립한다.
  • 알 수 없는 점에서 원래 클래스와 대상 클래스의 소프트맥스 출력이 동일하고, 다른 어떤 클래스의 출력보다도 높지 않도록 제약 조건을 부과한다.
  • 수치 최적화 기법을 사용하여 제약 조건이 있는 비볼록 문제를 해결하며, 표준 적대적 공격 방법과 유사한 계산 비용을 갖는다.
  • 주어진 방향을 따라 가장 가까운 플립 포인트를 효율적으로 계산하기 위해 이분법 알고리즘을 적용한다.
  • 픽셀 및 웨이블릿 계수 입력을 사용해 훈련한 모델에 대해 방법을 검증하여 다중 클래스 및 이산 특성 문제에의 적용 가능성을 입증한다.

실험 결과

연구 질문

  • RQ1비선형 활성화를 가진 훈련된 딥 신경망의 결정 경계 상 정확한 점을 비볼록 문제임에도 불구하고 계산할 수 있는가?
  • RQ2특히 ReLU 및 기타 비선형 활성화를 사용할 경우, 진정한 경계가 매우 비선형인 상황에서 결정 경계의 선형 근사는 얼마나 잘 작동하는가?
  • RQ3거리 제약을 사용하는 현재의 적대적 공격 방법이 실현 불가능성이나 최적성 부족으로 인해 진정한 최소 편향을 찾지 못할 정도로 얼마나 자주 실패하는가?
  • RQ4데이터셋 내 이미지 간 가장 가까운 플립 포인트까지의 거리는 어떻게 변동하는가? 그리고 고정된 거리 제약을 사용한 강건성 평가에 어떤 영향을 미치는가?
  • RQ5가장 가까운 플립 포인트를 계산하는 것이 도함수 기반 또는 마진 기반 근사보다 더 신뢰할 수 있고 정보가 풍부한 모델 신뢰도, 특성 영향력, 적대적 취약성 측정을 제공할 수 있는가?

주요 결과

  • 가장 가까운 플립 포인트 방법은 거리 제약 최적화로 발견된 것보다 훨씬 더 가까운 적대적 예제를 일관되게 식별한다. 그림 10에서 보듯이, 적대적 예제는 0.494보다 훨씬 작은 거리에서 경계를 횡단한다.
  • 거리 제약을 가진 적대적 공격 방법은 제약 반경이 너무 작을 경우 해를 찾지 못할 수 있다. 그림 11에서 보듯이, 가장 가까운 플립 포인트까지의 거리가 2.14인 이미지에서 0.5 반경 제약은 실패했다.
  • 가장 가까운 플립 포인트 방향과 손실 최소화를 통해 발견된 적대적 예제 방향 사이의 각도는 한 경우에서 12.7도에 불과했으며, 이는 가장 가까운 플립 포인트가 적대적 취약성에 대해 더 정확하고 정보가 풍부한 방향을 제공한다는 것을 시사한다.
  • 그림 12에서 보듯이, 데이터셋 내 이미지 간 가장 가까운 플립 포인트까지의 거리는 크게 변동한다. 이는 모든 입력에 대해 고정된 거리 제약을 사용한 강건성 평가가 효과적이지 않음을 의미한다.
  • 가장 가까운 플립 포인트를 찾는 데 드는 계산 비용은 표준 적대적 공격 방법과 유사하므로, 강건성 평가를 위한 실용적이고도 열등한 대안보다 뛰어난 선택이다.
  • 이 방법은 소프트맥스 마진이나 기울기 기반 거리 추정과 같은 근사 방법이 잘못된 정보를 줄 수 있음을 드러내며, 특히 비선형 영역에서는 결정 경계까지의 진정한 거리를 과대평가할 수 있음을 보여준다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.