[논문 리뷰] Human alignment of neural network representations
이 논문은 행동 유사도 평가를 통해 신경망 표현이 인간의 정신적 표현과 얼마나 유사한지 조사한다. 모델 규모나 아키텍처는 유사도에 미치는 영향이 미미한 반면, 훈련 데이터와 목적 함수가 훨씬 더 중요하다는 점을 발견하였다. 표현의 선형 변환은 다양한 데이터셋 간에 제로샷 유사도를 크게 향상시켰으며, 개념별로는 음식과 동물은 잘 표현되지만, 왕실 및 스포츠 관련 개념은 ImageNet 모델에서 잘 포착되지 않는다는 점을 확인하였다.
Today's computer vision models achieve human or near-human level performance across a wide variety of vision tasks. However, their architectures, data, and learning algorithms differ in numerous ways from those that give rise to human vision. In this paper, we investigate the factors that affect the alignment between the representations learned by neural networks and human mental representations inferred from behavioral responses. We find that model scale and architecture have essentially no effect on the alignment with human behavioral responses, whereas the training dataset and objective function both have a much larger impact. These findings are consistent across three datasets of human similarity judgments collected using two different tasks. Linear transformations of neural network representations learned from behavioral responses from one dataset substantially improve alignment with human similarity judgments on the other two datasets. In addition, we find that some human concepts such as food and animals are well-represented by neural networks whereas others such as royal or sports-related objects are not. Overall, although models trained on larger, more diverse datasets achieve better alignment with humans than models trained on ImageNet alone, our results indicate that scaling alone is unlikely to be sufficient to train neural networks with conceptual representations that match those used by humans.
연구 동기 및 목표
- 행동 반응에서 유추된 인간 정신적 표현과 신경망 표현이 얼마나 일치하는지 정도를 평가하는 것.
- 모델 크기나 아키텍처의 변화가 인간 유사도 평가와의 일치도를 향상시키는지 확인하는 것.
- 다양한 훈련 데이터셋과 목적 함수가 인간 유사 표현 학습에 미치는 영향을 평가하는 것.
- 신경망 표현의 선형 변환이 인간 유사도 평가 데이터셋 간에 일반화되는지 조사하는 것.
- 신경망 특징에서 잘 또는 못 표현된 인간 개념은 무엇인지 특정하는 것.
제안 방법
- 세 가지 데이터셋에서 인간의 유사도 평가를 수집하기 위해 이방성 작업(odd-one-out tasks)을 사용하여, 쌍별 이미지 선택을 통해 인간 개념 공간을 유추한다.
- 신경망 표현의 일치도는 이방성 정확도를 통해 평가되며, 모델 예측을 인간 선택과 비교한다.
- 일부 데이터셋에서 학습된 선형 변환을 사용하여 보류된 데이터셋에서의 이방성 정확도를 향상시키며, 제로샷 일반화 평가를 가능하게 한다.
- 인간 정신적 표현을 모델링하기 위해 희박 베이지안 모델(VICE)을 사용하여 삼중체를 이방성 요소가 구분하는 개념 차원으로 분류한다.
- CKA 및 R² 점수를 사용하여 다양한 모델(이미지넷, JFT-3B, 이미지/텍스트, 자기지도 학습 모델 포함)의 표현을 인간 개념과의 일치도로 평가한다.
- 45개의 VICE 차원에 걸쳐 제로샷 및 探측( probing) 이방성 정확도를 계산하여 개념별 일치도를 평가한다.
실험 결과
연구 질문
- RQ1모델 규모를 늘리거나 아키텍처를 변경하면 신경망 표현과 인간 유사도 평가 간의 일치도가 향상되는가?
- RQ2훈련 데이터와 목적 함수의 차이가 신경망 표현이 인간 행동 반응과의 일치도에 얼마나 영향을 미치는가?
- RQ3한 인간 유사도 데이터셋에서 학습된 신경망 표현의 선형 변환이 다른 데이터셋에서의 일치도 향상에 일반화되는가?
- RQ4어떤 인간 개념은 신경망 특징에서 잘 표현되고, 어떤 것은 약하게 표현되는가?
- RQ5이미지넷 훈련 모델은 더 큰, 더 다양한 데이터셋으로 훈련된 모델에 비해 인간 유사 개념 표현 측면에서 어떻게 비교되는가?
주요 결과
- 이미지넷 모델의 규모를 늘리면 이미지넷 정확도는 향상되지만, 인간 유사도 평가와의 일치도는 일관되게 향상되지 않으며, 일치도의 차이는 주로 목적 함수와 하이퍼파라미터에 의해 결정되며, 아키텍처나 깊이/너비와는 관련이 적다.
- 더 큰, 더 다양한 데이터셋(예: JFT-3B 또는 이미지/텍스트 데이터)으로 훈련된 모델은 이미지넷 전용 모델보다 인간 유사도 평가와의 일치도가 뚜렷이 높다.
- 한 데이터셋에서 학습된 신경망 표현의 선형 변환은 다른 두 개의 인간 유사도 평가 데이터셋에서 제로샷 이방성 정확도를 크게 향상시켜 강력한 일반화 잠재력을 보여준다.
- 음식 및 동물 관련 개념은 신경망 특징에서 잘 표현되지만, 왕실 및 스포츠 관련 물체의 표현은 약하며, 특히 이미지넷 모델에서 두드러지게 약하다.
- 이미지넷에서 뛰어난 성능을 보이는 최상의 이미지넷 모델도, 도구, 기술, 종이, 액체 등의 소수의 개념에서는 더 큰 모델(ViT-G/14 JFT)보다 성능이 떨어지며, 이는 개념별 편향이 있음을 시사한다.
- 회귀 R² 점수는 ViT-G/14 JFT 및 이미지/텍스트 모델이 이미지넷 모델보다 모든 45개의 VICE 카테고리에서 인간 개념 차원을 더 잘 설명함을 보여주며, 특히 왕실 및 스포츠 관련 개념에서 가장 큰 향상이 있었다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.