Skip to main content
QUICK REVIEW

[논문 리뷰] Do better ImageNet classifiers assess perceptual similarity better?

M. Kumar, Neil Houlsby|arXiv (Cornell University)|2022. 03. 09.
Advanced Image Fusion Techniques인용 수 13
한 줄 요약

이 논문은 더 나은 ImageNet 분류기가 더 우수한 인지적 유사도 측정값을 제공하는지 조사하며, 최신 아키텍처인 ResNets, EfficientNets, Vision Transformers에서 높은 ImageNet 정확도가 오히려 인지적 유사도 점수(PS)를 악화시킨다는 것을 발견한다. 놀랍게도, 과소적합 모델—특히 얕은 ResNets나 5 에포크 미만으로 훈련된 모델—이 가장 높은 PS를 기록하며, 정확도가 일정 수준을 초과하면 인지적 유사도가 떨어지는 파레토 경계가 존재함을 드러낸다.

ABSTRACT

Perceptual distances between images, as measured in the space of pre-trained deep features, have outperformed prior low-level, pixel-based metrics on assessing perceptual similarity. While the capabilities of older and less accurate models such as AlexNet and VGG to capture perceptual similarity are well known, modern and more accurate models are less studied. In this paper, we present a large-scale empirical study to assess how well ImageNet classifiers perform on perceptual similarity. First, we observe a inverse correlation between ImageNet accuracy and Perceptual Scores of modern networks such as ResNets, EfficientNets, and Vision Transformers: that is better classifiers achieve worse Perceptual Scores. Then, we examine the ImageNet accuracy/Perceptual Score relationship on varying the depth, width, number of training steps, weight decay, label smoothing, and dropout. Higher accuracy improves Perceptual Score up to a certain point, but we uncover a Pareto frontier between accuracies and Perceptual Score in the mid-to-high accuracy regime. We explore this relationship further using a number of plausible hypotheses such as distortion invariance, spatial frequency sensitivity, and alternative perceptual functions. Interestingly we discover shallow ResNets and ResNets trained for less than 5 epochs only on ImageNet, whose emergent Perceptual Score matches the prior best networks trained directly on supervised human perceptual judgements. The checkpoints for the models in our study are available at https://console.cloud.google.com/storage/browser/gresearch/perceptual_similarity.

연구 동기 및 목표

  • 개선된 ImageNet 분류 정확도가 더 나은 인지적 유사도 측정값을 이끌어내는지 조사하기.
  • 다양한 아키텍처와 하이퍼파라미터에서 ImageNet 정확도와 Perceptual Score(PS) 간의 관계를 탐구하기.
  • 분류 정확도와는 무관하게 인지적 유사도를 최적화하는 아키텍처 및 훈련 선택 사항을 규명하기.
  • 왜곡 내성, 공간 주파수 민감도, 표현 엔트로피와 같은 잠재적 요인들이 정확도-PS 교환관계의 근본 원인일 수 있는지 분석하기.
  • 현대 모델에서 아키텍처 수정이나 조기 정지로 인지적 유사도를 향상시킬 수 있는지 판단하기

제안 방법

  • 깊이, 너비, 가중치 감쇠, 레이블 스무딩, 드롭아웃, 훈련 스텝 수 등 다양한 하이퍼파라미터를 가진 ResNets, EfficientNets, Vision Transformers를 64×64 ImageNet에서 훈련하여 광범위한 ImageNet 분류기 모델을 구축하였다.
  • 모든 모델을 BAPPS 데이터셋에서 평가하여 인간 평가 기반 인지적 판단 기준을 활용해 Perceptual Score(PS)를 계산하였다.
  • 표현 속성 분석을 위해 활성화 엔트로피, 공간 주파수 민감도, 계층별 특징 통계를 분석하여 정확도-PS 교환관계의 근본 원인을 탐구하였다.
  • 스킵 연결이 있는지 없는지에 따라 모델을 비교하여 표현 엔트로피와 PS에 미치는 영향을 평가하였다.
  • 저통과 필터링을 사용해 왜곡에 대한 내성을 측정함으로써 고주파 성분에 의존하는 정도를 테스트하였다.
  • 재현성과 추가 분석을 위해 정기적으로(매 1000단계마다) 모델 체크포인트를 공개하였다.

실험 결과

연구 질문

  • RQ1더 높은 ImageNet 정확도가 PS로 측정된 인지적 유사도를 일관되게 향상시키는가?
  • RQ2ResNets나 Vision Transformers와 같은 현대 아키텍처에서 ImageNet 정확도와 인지적 유사도 간에 교환관계가 존재하는가?
  • RQ3스킵 연결 제거나 조기 정지와 같은 아키텍처 수정이 낮은 정확도에도 불구하고 인지적 유사도를 향상시킬 수 있는가?
  • RQ4낮은 PS를 기록하는 모델이 이미지 왜곡에 더 민감하거나 고주파 성분에 더 의존하는 정도는 어느 정도인가?
  • RQ5활성화 엔트로피와 공간 주파수 민감도와 같은 표현 수준의 특성은 인지적 유사도와 어떤 관계가 있는가?

주요 결과

  • ImageNet 정확도와 Perceptual Score(PS) 사이에 파레토 경계가 존재하며, 중간 수준의 정확도를 기록하는 모델이 가장 높은 PS를 기록하고, 정확도가 더 높아지면 인지적 유사도가 악화된다.
  • 얕은 ResNets(예: ResNet-6)와 5 에포크 미만으로 훈련된 모델은 이전에 인지적 유사도에서 최신 기술로 여겨졌던 AlexNet과 VGG와 비교해도 PS가 유사하거나 뛰어나다.
  • 높은 가중치 감쇠 또는 조기 정지를 적용한 ResNets는 낮은 ImageNet 정확도에도 불구하고 높은 PS를 기록하며, 이는 과적합이나 과최적화가 인지적 유사도 성능을 해칠 수 있음을 시사한다.
  • 스킵 연결을 제거하면 활성화 엔트로피는 증가하지만 PS는 향상되지 않아, 높은 엔트로피 자체가 인지적 유사도를 향상시키지 못한다는 것을 시사한다.
  • 낮은 PS를 기록하는 모델이 반드시 고주파 성분에 더 의존하는 것은 아니다. 저통과 필터링 실험 결과, 일부 고PS 모델(예: ResNet-6)은 낮은 PS 모델보다 더 강한 고주파 의존성을 보였다.
  • 깊이, 너비, 훈련 기간 등 여러 하이퍼파라미터에 걸쳐 정확도와 PS 사이의 역U자 관계가 유지되지만, 레이블 스무딩이나 드롭아웃에서는 일관되게 나타나지 않는다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.