[논문 리뷰] Robustified ANNs Reveal Wormholes Between Human Category Percepts
이 연구는 강화된 인공신경망(ANN)이 인간의 물체 카테고리 인식에 근본적으로 영향을 미치는 저노름 이미지 편향을 식별할 수 있음을 보여준다—이는 이러한 편향 하에서 인간 인식이 안정적이라는 가정에 도전하는 것이다. 이러한 편향은 이미지 공간 내 의미적으로 다른 인지 상태를 연결하는 '웜홀'처럼 작용하며, 기존에는 발견되지 못했던 인간 시각 처리의 약점을 드러내며, 최신의 ANNs를 통해 예측 가능하다.
The visual object category reports of artificial neural networks (ANNs) are notoriously sensitive to tiny, adversarial image perturbations. Because human category reports (aka human percepts) are thought to be insensitive to those same small-norm perturbations -- and locally stable in general -- this argues that ANNs are incomplete scientific models of human visual perception. Consistent with this, we show that when small-norm image perturbations are generated by standard ANN models, human object category percepts are indeed highly stable. However, in this very same "human-presumed-stable" regime, we find that robustified ANNs reliably discover low-norm image perturbations that strongly disrupt human percepts. These previously undetectable human perceptual disruptions are massive in amplitude, approaching the same level of sensitivity seen in robustified ANNs. Further, we show that robustified ANNs support precise perceptual state interventions: they guide the construction of low-norm image perturbations that strongly alter human category percepts toward specific prescribed percepts. These observations suggest that for arbitrary starting points in image space, there exists a set of nearby "wormholes", each leading the subject from their current category perceptual state into a semantically very different state. Moreover, contemporary ANN models of biological visual processing are now accurate enough to consistently guide us to those portals.
연구 동기 및 목표
- 인간의 물체 카테고리 인식이 저노름 이미지 편향에 대해 안정적이라는 일반적인 가정을 도전하기 위해.
- 표준 모델로는 탐지할 수 없는 인간의 인지적 혼란이 강화된 ANNs를 통해 드러날 수 있는지 조사하기 위해.
- 인식이 안정적이라고 여겨지는 저픽셀 예산 환경에서 인간 인식을 정밀하게 목표 지정하여 조절할 수 있는지 확인하기 위해.
- 현대적인 프라미테이트 볼루멘 경로의 ANN 모델이 이러한 인지적 '웜홀'의 발견을 정확히 이끌 수 있는지 평가하기 위해.
제안 방법
- 저노름 제약을 가진 ℓ₂-노름 훈련을 통해 ResNet50 기반 ANNs의 적대적 강건성을 향상시켜 소규모 편향에 대한 저항력을 높이기 위해.
- 강화된 ANNs의 잠재공간에서 기울기 기반 최적화를 통해 특정 카테고리 전환을 목표로 하는 저노름 이미지 편향 생성하기 위해.
- 인간과 유사한 분류 행동을 시뮬레이션하고 인지적 혼란 효과를 검증하기 위해 '서rogate' 모델 사용하기 위해.
- 119명의 참가자에게 편향된 이미지에 대한 인간의 인지 보고를 수집하여 카테고리 전환 빈도와 실수 빈도 측정하기 위해.
- 실수 빈도 보정을 적용하여 실수 없이 행동하는 조건에서 인간 행동을 추정하고, 인지 일치도 측정 지표의 신뢰도 향상시키기 위해.
- 저노름 편향(≤30 ℓ₂-노름) 하에서 인간의 인지 전환을 예측하는 데 있어 보통 ANNs와 강화된 ANNs를 체계적으로 비교하기 위해.

실험 결과
연구 질문
- RQ1강화된 ANNs는 저노름 편향 환경에서 인공지능과 인간 인식 간의 행동 일치 갭을 줄이는가?
- RQ2강화된 ANNs가 생성한 저노름 이미지 편향이 인간의 물체 카테고리 인식에 강력하고 신뢰할 수 있는 변화를 유도하는가?
- RQ3이미지 공간 전역에 걸쳐, 한 인지 상태에서 의미적으로 거리가 먼 다른 상태로 연결하는 '웜홀'—근접한 이미지 편향이 존재하는가?
- RQ4강화된 ANNs는 인간 인식을 정밀하게 목표 지정하여 임의의 지정된 카테고리로 조절할 수 있는가?
주요 결과
- 강화된 ANNs는 인간 관찰자에게 최대 약 90%의 카테고리 혼란을 유도하는 저노름 이미지 편향(≤30 ℓ₂-노름)을 발견하여, 인식의 안정성에 대한 가정에 도전했다.
- 강화된 ANNs에 의해 유도된 편향을 통해 인간의 인지 반응은 특정 카테고리로 강력하고 정밀하게 조절되었으며, 다중 대상 조절 작업에서 약 60%의 혼란 빈도를 보였다.
- 보통 ANNs와 인간 간의 행동 일치 갭은 컸지만, 강화된 ANNs는 특히 저픽셀 예산 환경에서 이 갭을 크게 줄였다.
- 강화된 ANNs는 인간의 인식을 한 카테고리에서 다른 카테고리로 신뢰성 있게 전환시킬 수 있는 정밀한 저노름 간섭을 가능하게 하여, 인지 공간 내 '웜홀' 존재를 시사했다.
- 결과는 현대적인 프라미테이트 볼루멘 경로의 ANN 모델이 이러한 인지적 포털의 발견을 일관되게 이끌 수 있을 정도로 충분히 정확하다는 것을 시사한다.
- 강력한 일치에도 불구하고 잔여 행동 갭이 남아 있어, 심지어 강화된 ANNs도 인간 시각 처리의 모든 측면을 완전히 반영하지 못할 수 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.