Skip to main content
QUICK REVIEW

[논문 리뷰] Neural Foundations of Mental Simulation: Future Prediction of Latent Representations on Dynamic Scenes

Aran Nayebi, Rishi Rajalingham|arXiv (Cornell University)|2023. 05. 19.
Neural dynamics and brain functionNeuroscience인용 수 3
한 줄 요약

이 연구는 다양한 동적이고 자연스러운 환경에서 미래 상태를 예측하기 위해 감각-인지 모델을 훈련하고 평가하여 정신적 시뮬레이션의 신경 기반 원리를 탐구한다. 분석 결과, 오직 다양한 자기 중심 작업으로 사전 훈련된 영상 기초 모델의 잠재 공간에서 미래 상태를 예측하는 모델만이 영장류의 뇌 신경 동역학과 인간의 행동 오류 패턴을 가장 잘 일치시키며, 이는 정신적 시뮬레이션의 핵심이 물리적 예측을 위해 다양한 환경에서 최적화된 재사용 가능한 동적 시각 표현에 기반한다는 것을 시사한다.

ABSTRACT

Humans and animals have a rich and flexible understanding of the physical world, which enables them to infer the underlying dynamical trajectories of objects and events, plausible future states, and use that to plan and anticipate the consequences of actions. However, the neural mechanisms underlying these computations are unclear. We combine a goal-driven modeling approach with dense neurophysiological data and high-throughput human behavioral readouts to directly impinge on this question. Specifically, we construct and evaluate several classes of sensory-cognitive networks to predict the future state of rich, ethologically-relevant environments, ranging from self-supervised end-to-end models with pixel-wise or object-centric objectives, to models that future predict in the latent space of purely static image-based or dynamic video-based pretrained foundation models. We find strong differentiation across these model classes in their ability to predict neural and behavioral data both within and across diverse environments. In particular, we find that neural responses are currently best predicted by models trained to predict the future state of their environment in the latent space of pretrained foundation models optimized for dynamic scenes in a self-supervised manner. Notably, models that future predict in the latent space of video foundation models that are optimized to support a diverse range of sensorimotor tasks, reasonably match both human behavioral error patterns and neural dynamics across all environmental scenarios that we were able to test. Overall, these findings suggest that the neural mechanisms and behaviors of primate mental simulation are thus far most consistent with being optimized to future predict on dynamic, reusable visual representations that are useful for Embodied AI more generally.

연구 동기 및 목표

  • 유연한 정신적 시뮬레이션을 가능하게 하는 뇌 및 행동 시스템의 인도적 편향(inductive biases)을 규명하는 것.
  • 최신 기계학습 모델이 미래 예측 과제에서 영장류의 뇌 신경 동역학과 인간의 행동 패턴을 재현할 수 있는지 평가하는 것.
  • 정신적 시뮬레이션 과정에서 가림된 물리적 궤적을 예측할 때 가장 잘 예측하는 모델 아키텍처, 손실 함수, 사전 훈련 방식을 규명하는 것.
  • 다양하고 높은 변동성이 있는 환경 및 훈련 분포를 초월한 새로운 시나리오로의 일반화 능력을 평가하는 것.
  • 잠재 공간에서 미래 예측을 위해 훈련된 모델이 입력에서 직접 관측되지 않는 숨겨진 물리적 상태 변수를 추론할 수 있는지 탐구하는 것.

제안 방법

  • 픽셀 수준 또는 개체 슬롯 목표를 가진 엔트리 투 엔트리(self-supervised) 모델과 정적 또는 동적 기초 모델의 잠재 공간에서 미래를 예측하는 모델을 포함한 다양한 감각-인지 네트워크 클래스를 훈련하고 평가함.
  • 부분적으로 가려진 상황에서 영장류 전 frontal 피질의 고밀도 신경 생리학적 기록을 사용하여 정신적 토너먼트(Mental-Pong) 작업 중의 모델 예측을 기준으로 삼음.
  • 수천 개의 비교를 포함한 고속도 인간 행동 데이터를 활용하여 모델의 미래 예측 성능과 오류 패턴을 평가함.
  • 시각적으로 숨겨진 상태 변수(예: 속도)를 포함한 실제 환경 상태 변수와의 비교를 통해 암묵적인 물리적 이해 수준을 테스트함.
  • 물리적 시나리오 기준(Physion)에서 다양한 동적 장면(강체, 연성 물체(drape), 복잡한 상호작용 포함)을 대상으로 모델을 평가함.
  • 다중 타임스텝에 걸쳐 예측을 전개할 수 있도록 전방 동역학 헤드를 도입하여 장기 예측 일반화 능력을 평가함.

실험 결과

연구 질문

  • RQ1가려진 물리적 궤적의 정신적 시뮬레이션 과정에서 영장류 전전두피질의 뇌 신경 동역학을 가장 잘 예측하는 모델 아키텍처와 훈련 목표는 무엇인가?
  • RQ2잠재 공간에서 미래 예측을 위해 훈련된 모델은 입력에서 직접 관측되지 않는 숨겨진 물리적 상태 변수(예: 속도)를 추론할 수 있는가?
  • RQ3모델은 훈련 분포를 초월한 새로운 환경과 고변동성 시나리오로의 일반화 능력은 어떠한가?
  • RQ4자기 중심 영상 데이터로 사전 훈련된 기초 모델이 정적 이미지나 픽셀 수준 복원 작업으로 사전 훈련된 모델보다 뇌 및 행동 반응을 더 잘 예측하는가?
  • RQ5재사용 가능한, 인자화된, 개체 중심의 표현 방식이 정확하고 생물학적으로 타당한 정신적 시뮬레이션을 가능하게 하는 데 어떤 역할을 하는가?

주요 결과

  • 모든 테스트 환경에서 오직 영상 기초 모델의 잠재 공간에서 미래 상태를 예측하는 모델만이 영장류의 뇌 신경 동역학과 인간의 행동 오류 패턴을 가장 잘 일치시킴.
  • 픽셀 수준 복원 또는 개체 슬롯 예측을 위해 훈련된 모델들은 심지어 스케일업이 되어도 일반화 능력이 떨어지며, 이는 스케일만으로는 정신적 시뮬레이션을 달성할 수 없다는 것을 시사함.
  • 최고의 성능을 보인 모델들은 명시적으로 훈련되지 않았음에도 불구하고 은폐된 물리적 상태 변수(예: 속도)를 성공적으로 예측함으로써 암묵적인 물리적 이해가 존재함을 시사함.
  • 기초 모델의 잠재 공간은 동일하지 않음: 동적 자기 중심 영상 데이터(예: Ego4D)로 사전 훈련된 모델이 정적 이미지나 비자기 중심 데이터로 사전 훈련된 모델보다 우수함.
  • 뇌 데이터와 가장 잘 일치하는 모델 클래스는 연성 물체 'Drape' 시나리오에서도 오직 유일하게 잘 일반화하는 것으로 나타나며, 다른 모든 모델은 이 시나리오에서 심각한 어려움을 겪음.
  • 뇌 반응은 재사용 가능한 동적 잠재 공간에서 미래 상태를 예측하도록 훈련된 모델에 의해 가장 잘 예측됨을 확인하여, 정신적 시뮬레이션의 핵심 인도적 편향이 이러한 표현 방식에 기반한다는 것을 시사함.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.