[논문 리뷰] Are Vision Transformers More Data Hungry Than Newborn Visual Systems?
이 연구는 시각 트랜스포머(ViTs)가 태아 시각 시스템보다 더 많은 데이터가 필요하다는 가정을 도전한다. 제한된 환경에서 양육된 신생아 닭들이 수집한 제1인칭 시각 데이터를 기반으로 ViTs를 훈련시켜, 신체적 경험과 시간적 대비 목표를 활용한 자기지도 학습을 통해 ViTs가 닭과 동일한 시점 불변 물체 인식 성능을 달성함으로써, ViTs가 생물학적으로 현실적인 희소한 시각 경험에서 훈련될 경우 본질적으로 더 많은 데이터가 필요하지 않음을 보여준다.
Vision transformers (ViTs) are top performing models on many computer vision benchmarks and can accurately predict human behavior on object recognition tasks. However, researchers question the value of using ViTs as models of biological learning because ViTs are thought to be more data hungry than brains, with ViTs requiring more training data to reach similar levels of performance. To test this assumption, we directly compared the learning abilities of ViTs and animals, by performing parallel controlled rearing experiments on ViTs and newborn chicks. We first raised chicks in impoverished visual environments containing a single object, then simulated the training data available in those environments by building virtual animal chambers in a video game engine. We recorded the first-person images acquired by agents moving through the virtual chambers and used those images to train self supervised ViTs that leverage time as a teaching signal, akin to biological visual systems. When ViTs were trained through the eyes of newborn chicks, the ViTs solved the same view invariant object recognition tasks as the chicks. Thus, ViTs were not more data hungry than newborn visual systems: both learned view invariant object representations in impoverished visual environments. The flexible and generic attention based learning mechanism in ViTs combined with the embodied data streams available to newborn animals appears sufficient to drive the development of animal-like object recognition.
연구 동기 및 목표
- 시각 트랜스포머(ViTs)가 일반적으로 상정하는 바와 같이, 신생아 시각 시스템보다 더 많은 데이터가 필요한지 테스트하기 위해.
- 동일한 시각 훈련 조건에서 ViTs와 신생아 닭 간의 학습 성능을 직접 비교하기 위해.
- 가상의 동물 침대에서의 제1인칭 시각 데이터를 기반으로 훈련된 자기지도 학습 ViTs가 닭 수준의 시점 불변 물체 인식을 달성할 수 있는지 조사하기 위해.
- ViTs의 주의 기반, 순서 학습 메커니즘이 생물학적 시스템에서 관찰되는 핵심 시각 능력을 재현하는 데 충분한지 평가하기 위해.
- 일반적인 학습 메커니즘과 함께 신체적 데이터를 조합할 경우 빠르고 영리한 시각 학습을 이끌 수 있는지 탐색하기 위해.
제안 방법
- 단일 물체가 포함된 제한된 시각 환경에서 신생아 닭들을 대상으로 통제된 양육 실험을 수행하고, 그들의 시점 불변 물체 인식 성능을 측정하였다.
- Unity 3D를 사용하여 닭의 양육 침대의 디지털 트윈을 구축하여 닭의 제1인칭 시각 경험을 시뮬레이션하였다.
- 시뮬레이션된 침대를 통해 이동하는 가상 에이전트로부터 제1인칭 이미지 시퀀스를 기록하여, 닭들이 접근할 수 있는 시각 데이터를 확보하였다.
- 시간에 따른 대비 목표를 활용한 대비 학습을 통해 자기지도 학습 시각 트랜스포머를 훈련시켰으며, 300ms 이내의 연속된 시점들이 임베딩 공간에서 유사해지도록 하였다.
- ViT의 백본을 동결하고, 이전 층에 선형 분류기를 부착하여 닭 실험에서 사용된 동일한 刺자에 대해 교차 검증 평가를 수행하였다.
- ViT의 주의 헤드에서 유도된 시각화 열지도를 사용하여 추론 중 특징 중요도와 주의 패턴을 분석하였다.

실험 결과
연구 질문
- RQ1ViTs가 동일한 시각 경험에서 훈련될 경우, 신생아 시각 시스템보다 더 많은 데이터가 필요한가?
- RQ2신체적이고 시간적으로 구조화된 시각 경험에서 훈련된 자기지도 학습 ViTs가 신생아 닭과 동등한 물체 인식 성능를 달성할 수 있는가?
- RQ3일반적인 주의 기반 학습 메커니즘이 사전 유도적 편향 없이 시점 불변 물체 표현을 개발하는 데에 충분한가?
- RQ4신생아 동물이 접근할 수 있는 시각 데이터 스트림은 인공 시스템에서의 빠른 학습을 지원할 수 있는가?
- RQ5디지털 트윈 실험을 통해 생물학적 및 인공 학습 시스템 간의 직접적이고 공정한 비교를 가능하게 할 수 있는가?
주요 결과
- 가상 닭 양육 침대에서의 제1인칭 시각 데이터를 기반으로 훈련된 ViTs는 신생아 닭과 동일한 시점 불변 물체 인식 성능를 달성하였다.
- 시간을 교육 신호로 활용한 대비 학습을 통해 자기지도 학습 ViT는 극히 적은, 제한된 시각 입력에서 물체 표현을 성공적으로 학습하였다.
- 시각화 열지도 분석 결과, ViT의 주의 헤드가 관련 물체 특징에 집중하는 것으로 나타났으며, 생물학적 시스템에서 관찰된 주의 패턴과 유사하였다.
- 이 결과는 ViTs가 생물학적 뇌보다 훨씬 더 많은 데이터가 필요하다는 가정을 도전하며, 두 시스템 모두 유사한 데이터 분포에서 효과적으로 학습됨을 보여주었다.
- 이 연구는 일반적인 주의 기반 학습 메커니즘과 함께 신체적 데이터 스트림을 조합할 경우 동물 수준의 물체 인식을 개발하는 데에 충분하다는 것을 입증하였다.
- 결과는 일반적인 순서 학습 메커니즘이 환경과의 상호작용을 통해 도메인 특화된 시각 능력을 유도할 수 있다는 '단일 시스템' 가설을 지지한다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.