Skip to main content
QUICK REVIEW

[논문 리뷰] Adversarially trained neural representations may already be as robust as corresponding biological neural representations

Chong Guo, Michael J. Lee|arXiv (Cornell University)|2022. 06. 19.
Yersinia bacterium, plague, ectoparasites researchBiochemistry, Genetics and Molecular Biology인용 수 19
한 줄 요약

이 연구는 영장류 하위경부피질(IT) 코皮의 신경 활동에 직접적으로 적대적 공격을 수행하는 방법을 제시하며, 영장류의 생물학적 신경 표현이 최신의 강건하게 훈련된 인공신경망과 유사한 수준의 적대적 민감성을 보임을 드러낸다. 주요 발견은 IT 뉴런이 매우 작은 $l_2$-노름 노이즈(최소 $ = 2.5$)에 취약하다는 점으로, 이는 생물학적 시각 체계가 인공 시스템보다 본질적으로 더 강건하다는 오랜 가정을 도전한다.

ABSTRACT

Visual systems of primates are the gold standard of robust perception. There is thus a general belief that mimicking the neural representations that underlie those systems will yield artificial visual systems that are adversarially robust. In this work, we develop a method for performing adversarial visual attacks directly on primate brain activity. We then leverage this method to demonstrate that the above-mentioned belief might not be well founded. Specifically, we report that the biological neurons that make up visual systems of primates exhibit susceptibility to adversarial perturbations that is comparable in magnitude to existing (robustly trained) artificial neural networks.

연구 동기 및 목표

  • 영장류 시각 체계의 고차원 생물학적 신경 표현이 실제로 인공신경망보다 적대적 노이즈에 더 강건한가를 테스트하는 것.
  • 이전 신경과학 연구들이 랜덤하거나 굵은 이미지 노이즈에 의존한 점을 극복하기 위해, 신경 기록에 대해 타겟팅되고 반복적인 공격 방법을 개발하는 것.
  • 통제된 $l_2$-노름 노이즈 예산 하에, 개별 IT 뉴런과 강건하게 훈련된 깊은 신경망의 유닛 간에 적대적 민감성을 직접 비교하는 것.
  • 영장류 시각 인식의 강건성이 개별 뉴런의 내성 강건성보다는 인구 수준의 오류 보정 메커니즘 때문인가를 조사하는 것.

제안 방법

  • 영장류 신경 기록에 맞춘 반복적 투영 경사 하강(_PG_D) 공격을 개발하여, 신경 반응을 서로서의 손실로 사용해 적대적 노이즈를 최적화하는 데 사용하였다.
  • 두 단계의 PGD 전략을 적용: 먼저 더 큰 $l_2$-구역($2\epsilon$)에서 최적화하여 탐색 능력을 향상시키고, 이후 $\epsilon$로 정밀한 노이즈를 조정하였다.
  • 재시작을 포함한 시뮬레이션 냉각 기법을 사용하여, 진전이 없을 경우 단계 크기를 10% 감소시켰고, 최대 4번 반복하여 局부 최적값에서 벗어나도록 하였다.
  • 영장류 시각 처리의 기계적 모델을 활용해, 개별 IT 뉴런의 반응 변화를 최대화하는 이미지 노이즈를 생성하였다.
  • $l_2$-노름 제약 조건 하에 최악의 상황을 고려해 최적화하여, 적대적 민감도가 뉴런 반응 변화의 하한선으로 측정되도록 보장하였다.
  • $\epsilon = 3$에서 IT 뉴런, 표준 ResNet50, 그리고 적대적으로 훈련된 네트워크(AT-ResNet50, AT-WRN50-4) 간의 적대적 민감도를 비교하여 결과를 검증하였다.

실험 결과

연구 질문

  • RQ1영장류 IT 뉴런은 딥러닝 강건성 연구에서 사용되는 것과 유사한 크기의 $l_2$-노름 적대적 노이즈에 취약한가?
  • RQ2개별 IT 뉴런의 적대적 민감도는 최신의 강건하게 훈련된 인공신경망의 유닛과 정량적으로 어떻게 비교되는가?
  • RQ3영장류 시각 인식의 강건성은 개별 뉴런의 내성 강건성 때문인가, 아니면 인구 수준의 오류 보정 메커니즘 때문인가?
  • RQ4모델의 전체 액세스 권한이 없음에도 불구하고, 기반 기반 최적화를 통해 생물학적 신경 기록에 효과적으로 적대적 공격를 적용할 수 있는가?
  • RQ5IT 뉴런에서의 적대적 예제는 이미지 공간에 조밀하게 존재하는가? 즉, 어떤 이미지도 범주 선택성을 변화시킬 수 있도록 노이즈를 가할 수 있는가?

주요 결과

  • 영장류 IT 뉴런은 인간에게 거의 인식되지 않을 정도로 거의 눈에 띄지 않는 $\epsilon = 2.5$ 수준의 $l_2$-노름 노이즈에 적대적 민감성을 보인다.
  • $\epsilon = 3$일 때 IT 뉴런의 평균 적대적 민감도는 적대적으로 훈련된 DNN(AT-ResNet50, AT-WRN50-4)와 유사한 크기로, 생물학적 강건성의 우월성에 대한 가정을 도전한다.
  • 적대적 노이즈는 개별 IT 뉴런의 범주 선택성을 완전히 변화시킬 수 있으며, 이는 그들의 반응이 소규모이고 정확한 픽셀 변화에 매우 민감하다는 것을 시사한다.
  • 이 연구는 특정 이미지 주변에 적대적 예제가 이미지 공간에서 조밀하게 존재함을 입증하여, 시각 표현 전반에 걸쳐 광범위한 취약성을 시사한다.
  • 강건하게 훈련된 인공신경망은 이미 개별 유닛 수준에서 생물학적 신경 표현의 적대적 강건성 수준을 도달하거나 초월하고 있다.
  • 결과는 영장류 시각 행동의 강건성이 개별 뉴런의 내성 강건성에서 기인하는 것이 아니라, 후행적 인구 수준의 디코딩 또는 오류 보정 메커니즘에서 기인할 수 있음을 암시한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.