Skip to main content
QUICK REVIEW

[论文解读] Can Vision Replace Text in Working Memory? Evidence from Spatial n-Back in Vision-Language Models

Sichu Liang, Hongyu Zhu|arXiv (Cornell University)|Feb 4, 2026
Neurobiology of Language and Bilingualism被引用 0
一句话总结

该论文比较文本式大模型与视觉-语言模型在文本网格和图像网格刺激下的空间前瞻(n-back)表现,发现模态依赖的性能差距,并提供基于近期策略与干扰的证据在视觉格式中的体现。

ABSTRACT

Working memory is a central component of intelligent behavior, providing a dynamic workspace for maintaining and updating task-relevant information. Recent work has used n-back tasks to probe working-memory-like behavior in large language models, but it is unclear whether the same probe elicits comparable computations when information is carried in a visual rather than textual code in vision-language models. We evaluate Qwen2.5 and Qwen2.5-VL on a controlled spatial n-back task presented as matched text-rendered or image-rendered grids. Across conditions, models show reliably higher accuracy and d' with text than with vision. To interpret these differences at the process level, we use trial-wise log-probability evidence and find that nominal 2/3-back often fails to reflect the instructed lag and instead aligns with a recency-locked comparison. We further show that grid size alters recent-repeat structure in the stimulus stream, thereby changing interference and error patterns. These results motivate computation-sensitive interpretations of multimodal working memory.

研究动机与目标

  • 在多模态模型中,改变表征代码(文本 vs. 视觉)是否会保留原本的工作记忆计算的意图?
  • 评估模态如何影响空间n-back任务中的更新、时序绑定与干扰控制。
  • 提供过程层面的诊断,以解释超越端点准确度的WM样行为。

提出的方法

  • 在匹配的文本呈现网格和图像呈现网格上,评估Qwen2.5(文本)与Qwen2.5-VL(视觉-语言)在空间n-back任务中的表现。
  • 使用确定性解码以确保逐试次的可重复性。
  • 计算标准WM指标(准确率、命中率、误警率、d′)以及基于逐试次对数概率的证据分数(s_t)。
  • 通过重新用不同滞后定义(k ∈ {1,2,3})标注试次,进行滞后扫描分析,以评估证据是否与指示的滞后一致或与近期策略相符。
  • 通过改变网格大小N(3、4、5、7)研究最近重复(诱饵)带来的干扰及其对辨别性的影响。
  • 在文本网格和视觉网格输入下,评估跨模型家族(Llama3 与 Qwen 变体)与尺度的鲁棒性。

实验结果

研究问题

  • RQ1在匹配的空间n-back任务中,用视觉替代文本是否会产生相同的WM样计算,还是呈现模态驱动的策略转变?
  • RQ2多模态模型中时间上下文绑定和干扰控制在文本网格与视觉网格表示之间有何差异?
  • RQ3网格大小与名义负载如何影响跨模态的可辨别性与干扰模式?
  • RQ4在不同滞后下,性能是否主要受保守决策标准影响,还是证据分离性较弱?
  • RQ5滞后基础的诊断是否揭示在更高负载下的近期锁定处理而非指示滞后一致?

主要发现

  • 在负载与网格大小之间,文本网格输入的可辨别性高于文本网格视觉(vision),而视觉网格表现最差。
  • 敏感性d′随名义负载(1-back到2/3-back)显著下降,且视觉网格条件长期低于文本网格基线。
  • 滞后扫描分析显示,分级证据往往与1-back的近期锁定比较一致,而非指示的n-back滞后,尤其对于n=2、3。
  • 网格大小效应显示更大网格提升可辨别性,但视觉网格长期显著低于文本网格基线;最近重复(诱饵)的干扰构成了网格大小优势的很大部分。
  • 过程诊断显示视觉网格常呈现保守性偏置(命中率低、误报率低)及证据分离性弱,AUC在k=1处达到峰值而非在k=n处。
  • 跨LLM/VLM家族(Llama3与Qwen变体)的鲁棒性检验呈现相同的定性模式:文本网格优于视觉网格且模态顺序显著,且更大网格通常提升d′,但幅度因模型而异。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。