[논문 리뷰] Can Vision Replace Text in Working Memory? Evidence from Spatial n-Back in Vision-Language Models
논문은 텍스트 기반 LLM과 시각-언어 모델의 매치된 텍스트-그리드 및 이미지-그리드 자극에서 공간 n-back 성능을 비교하고, 양식에 의존적인 성능 격차와 최근성 기반 전략 및 시각 형식에서의 간섭 증거를 발견한다.
Working memory is a central component of intelligent behavior, providing a dynamic workspace for maintaining and updating task-relevant information. Recent work has used n-back tasks to probe working-memory-like behavior in large language models, but it is unclear whether the same probe elicits comparable computations when information is carried in a visual rather than textual code in vision-language models. We evaluate Qwen2.5 and Qwen2.5-VL on a controlled spatial n-back task presented as matched text-rendered or image-rendered grids. Across conditions, models show reliably higher accuracy and d' with text than with vision. To interpret these differences at the process level, we use trial-wise log-probability evidence and find that nominal 2/3-back often fails to reflect the instructed lag and instead aligns with a recency-locked comparison. We further show that grid size alters recent-repeat structure in the stimulus stream, thereby changing interference and error patterns. These results motivate computation-sensitive interpretations of multimodal working memory.
연구 동기 및 목표
- 표현 코드(text vs. vision)를 바꾼다고 해서 멀티모달 모델에서 의도된 작업 기억 계산이 보존되는지 동기를 부여한다.
- 양식이 공간 n-back 작업에서 업데이트, 시간 결합, 간섭 제어에 미치는 영향을 평가한다.
- 엔드포인트 정확도 이외의 WM 유사 행동 해석을 위한 프로세스 수준 진단을 제공한다.
제안 방법
- 텍스트-렌더링된 그리드와 이미지-렌더링 그리드로 매치된 공간 n-back 작업에서 Qwen2.5(텍스트)와 Qwen2.5-VL(시각-언어)을 평가한다.
- trial-by-trial 재현성을 보장하기 위해 결정론적 디코딩을 사용한다.
- 표준 WM 지표(정확도, 타격률, 오탐률, d′) 및 trial-wise 로그-확률 기반 증거 점수(s_t)를 계산한다.
- 지시된 lag와의 일치를 확인하기 위해 다른 lag 정의(k ∈ {1,2,3})으로 trial에 재레이블링하는 lag-scan 분석을 수행한다.
- 최근 반복(lures)으로 인한 간섭과 discriminability에 미치는 영향을 연구하기 위해 격자 크기 N(3,4,5,7)를 조작한다.
- 텍스트-그리드 입력과 시각-그리드 입력을 사용하여 모델 계열(Llama3 및 Qwen 변형)과 규모에 따른 강건성을 평가한다.
실험 결과
연구 질문
- RQ1텍스트를 시각으로 대체한 매치된 공간 n-back 작업이 동일한 WM 유사 계산을 산출하는지, 아니면 전략에 양식 주도적 변화가 있는지?
- RQ2다중 모달 모델에서 텍스트-그리드와 시각-그리드 표현 간 시간 맥락 결합과 간섭 제어가 어떻게 다른지?
- RQ3격자 크기와 명목 부하가 양식 간 구분성 및 간섭 패턴에 어떤 영향을 미치는지?
- RQ4성능은 주로 보수적 결정 기준에 의해 제한되는가, 아니면 다른 lag에서 증거 분리성이 약한 탓인가?
- RQ5lag 기반 진단이 더 큰 부하에서 지시된 lag 매칭이 아니라 최근성 잠금 처리(recency-locked processing)를 드러내는가?
주요 결과
- 로드와 격자 크기 전반에 걸쳐 텍스트-그리드 입력은 텍스트-그리드 비전보다 구분성이 높고, 시각-그리드 비전은 최악이다.
- 감도 d′는 명목 부하(1-back에서 2/3-back)에서 조건에 따라 크게 감소하고, 시각-그리드 조건은 텍스트-그리드 기준선 이하로 현저히 남아 있다.
- lag-scan 분석은 등급화된 증거가 1-back의 최근성 잠금 비교와 정렬되는 경향을 보이며, 특히 n=2,3에서 그렇다.
- 격자 크기 효과는 더 큰 격자가 구분성을 개선하지만 시각-그리드 조건은 여전히 텍스트-그리드 기준선 아래에 머물며, 최근 반복으로 인한 간섭이 격자 크기 이점의 많은 부분을 뒷받침한다.
- 프로세스 진단은 시각-그리드가 종종 보수적 편향(낮은 타격율, 낮은 오탐)과 약한 증거 분리를 보이며, AUC가 n이 아닌 k=1에서 피크를 이룬다.
- LLM/VLM 계열(Llama3 및 Qwen 변형) 간의 강건성 확인에서 동일한 정성적 패턴: 텍스트-그리드 > 시각-그리드 순으로 모달리티 순서가 있고, 더 큰 격자가 일반적으로 d′를 증가시키나 규모에 따라 크기는 다르다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.