[논문 리뷰] Harmonizing the object recognition strategies of deep neural networks with humans
이 논문은 깊이 신경망(DNNs)의 정확도가 증가함에 따라 객체 인식에서 인간의 시각 전략과 점점 더 괴리가 생기고 있음에도 불구하고, 이에 대한 경향을 규명한다. 이는 신경 조율기(neural harmonizer)라는 학습 가능한 모듈을 도입하여 DNN을 인간의 주의 집중 패턴과 특징 통합 방식에 맞추어 공동 학습시킴으로써 해결한다. 이는 특히 비전 트랜스포머에서 인간과 유사한 전략 준수와 분류 정확도를 동시에 향상시킨다.
The many successes of deep neural networks (DNNs) over the past decade have largely been driven by computational scale rather than insights from biological intelligence. Here, we explore if these trends have also carried concomitant improvements in explaining the visual strategies humans rely on for object recognition. We do this by comparing two related but distinct properties of visual strategies in humans and DNNs: where they believe important visual features are in images and how they use those features to categorize objects. Across 84 different DNNs trained on ImageNet and three independent datasets measuring the where and the how of human visual strategies for object recognition on those images, we find a systematic trade-off between DNN categorization accuracy and alignment with human visual strategies for object recognition. State-of-the-art DNNs are progressively becoming less aligned with humans as their accuracy improves. We rectify this growing issue with our neural harmonizer: a general-purpose training routine that both aligns DNN and human visual strategies and improves categorization accuracy. Our work represents the first demonstration that the scaling laws that are guiding the design of DNNs today have also produced worse models of human vision. We release our code and data at https://serre-lab.github.io/Harmonization to help the field build more human-like DNNs.
연구 동기 및 목표
- 스케일링 법칙에 따라 학습된 DNN의 정확도 향상 경향이 인간의 시각 전략과의 일치도 향상에 기여하는지 조사하기 위해.
- DNN의 정확도와 인간의 주의 집중 및 특징 통합 패턴과의 일치도 사이에 체계적인 트레이드오프가 존재하는지 규명하기 위해.
- 성능을 희생시키지 않고 DNN의 시각 전략을 인간과 유사하게 향상시키는 일반적인 학습 방법을 개발하기 위해.
- 다양한 DNN 아키텍처에서 인간 일치도와 작업 정확도를 동시에 향상시키는 확장 가능한 솔루션—신경 조율기를 제공하기 위해.
제안 방법
- 저자들은 ImageNet 이미지에서 인간이 어디에 주목하는지를 정의하기 위해 ClickMe 및 Clicktionary 데이터셋의 인간이 주석 처리한 특징 중요도 맵을 사용한다.
- 인간이 시각적 특징을 카테고리 결정에 어떻게 통합하는지 측정하기 위해 새로운 심리물리적 데이터를 수집하여 인간의 시각 전략의 '어떻게'를 포착한다.
- 신경 조율기는 분류 정확도와 인간의 주의 집중 및 특징 통합에 대한 일치도를 동시에 최적화하는 기능을 갖춘, 미분 가능하고 즉각 통합 가능한 모듈이다.
- 조율기는 이중 손실 목적함수를 사용한다: 하나는 DNN의 특징 맵을 인간이 주석 처리한 중요도 맵과 일치시키는 것이고, 다른 하나는 인간과 유사한 특징 통합 방식을 유지하는 것이다.
- 이 방법은 비전 트랜스포머(ViT), ResNets, 그리고 적대적 로버스트니를 위해 학습된 모델 등을 포함한 총 84종의 다양한 DNN에 적용된다.
- 신경 조율기의 학습은 엔드 투 엔드 백프로파게이션을 통해 수행되어 표준 DNN 아키텍처와의 호환성을 보장한다.
실험 결과
연구 질문
- RQ1스케일링 법칙에 따라 학습된 DNN의 정확도 향상 경향이 객체 인식에서 인간의 시각 전략과의 일치도 향상에 기여하는가?
- RQ2DNN은 객체 분류 과정에서 인간의 주의 집중 패턴(어디에)과 특징 통합 행동(어떻게)을 어느 정도 재현하는가?
- RQ3일반적인 학습 모듈을 통해 DNN의 정확도와 인간의 시각 전략과의 일치도를 동시에 향상시킬 수 있는가?
- RQ4신경 조율기는 인도크티브 바이어스가 낮은 모델, 예를 들어 비전 트랜스포머에서 더 큰 향상 효과를 낼 수 있는가?
- RQ5DNN과 인간 간의 일치도 부족 현상은 모델 최적화가 데이터셋의 편향을 악용하기 때문이 아니라 인간과 유사한 표현을 학습하지 못하기 때문인가?
주요 결과
- DNN 정확도와 인간의 시각 전략과의 일치도 사이에 체계적인 트레이드오프가 존재한다: DNN의 정확도가 높아질수록 인간의 주의 집중 및 특징 통합과의 일치도는 감소한다.
- 이 트레이드오프는 ClickMe, Clicktionary, 그리고 저자들이 자체적으로 수행한 심리물리적 실험을 포함한 세 개의 독립된 데이터셋에서 일관되게 관찰된다.
- 신경 조율기는 인간의 시각 전략과의 일치도를 크게 향상시킨다—조율된 DNN은 비교한 모든 다른 DNN보다 일치도 지표에서 뛰어나다.
- 조율된 비전 트랜스포머(ViT)는 일치도 향상에서 가장 큰 성과를 보이며, 이는 이 방법이 인도크티브 바이어스가 낮은 모델에 특히 효과적임을 시사한다.
- 신경 조율기는 일치도 향상 외에도 DNN 성능을 향상시킨다—조율된 모델은 조율되지 않은 모델보다 더 높은 정확도를 달성한다.
- 조율된 ViT는 조율되지 않은 모델보다 더 효율적으로 시각적 특징을 결정에 통합하여 인간과 유사한 통합 패턴을 더 잘 모방한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.