[论文解读] Learning word-referent mappings and concepts from raw inputs
该论文提出了一种自监督深度学习模型,能够直接从原始图像和文本中学习词与指代物的映射关系,无需预先分割的对象,利用跨情境学习来消除词义歧义。该模型实现了准确的词-物体对齐,能泛化到新实例,通过注意力图实现指代物定位,并表现出对互斥性的偏好,证明了从未经处理的感官输入中端到端学习词汇的可行性。
How do children learn correspondences between the language and the world from noisy, ambiguous, naturalistic input? One hypothesis is via cross-situational learning: tracking words and their possible referents across multiple situations allows learners to disambiguate correct word-referent mappings (Yu & Smith, 2007). However, previous models of cross-situational word learning operate on highly simplified representations, side-stepping two important aspects of the actual learning problem. First, how can word-referent mappings be learned from raw inputs such as images? Second, how can these learned mappings generalize to novel instances of a known word? In this paper, we present a neural network model trained from scratch via self-supervision that takes in raw images and words as inputs, and show that it can learn word-referent mappings from fully ambiguous scenes and utterances through cross-situational learning. In addition, the model generalizes to novel word instances, locates referents of words in a scene, and shows a preference for mutual exclusivity.
研究动机与目标
- 开发一种计算模型,从原始视觉和语言输入中学习词-指代物映射,绕过简化的符号表示。
- 探究是否能直接从像素级图像和未经处理的文本中实现跨情境词汇学习。
- 评估模型在新实例上对已学习词汇的泛化能力,以及在场景中定位指代物的能力。
- 考察模型在词汇学习中是否表现出互斥性等认知偏见。
- 评估在从模糊、自然主义输入中学习词-指代物映射时,对象分割是否为必要条件。
提出的方法
- 模型通过自监督在对比判别任务上进行训练:区分匹配与不匹配的场景和字幕对。
- 每个输入由一个56×56像素的2×2网格MNIST数字图像和一个包含四个对应数字词的字幕组成。
- 通过重新排列词-物体对应关系生成不匹配对,模拟模糊的学习情境。
- 模型使用卷积神经网络(Scene-CNN)直接处理完整图像,学习联合视觉-语言表征,无需事先进行目标检测。
- 在评估期间,使用注意力图来定位目标词在场景中的预测指代物。
- 通过在缺少特定数字的场景中进行训练,并在模糊情境下评估对新数字的偏好,来测试互斥性。
实验结果
研究问题
- RQ1神经网络能否通过跨情境学习,从未处理的图像和未经处理的文本中学习到正确的词-指代物映射?
- RQ2当在原始输入上进行训练时,模型是否能对已知词汇的新实例实现泛化?
- RQ3模型能否使用注意力机制在场景中准确定位某个词的正确指代物?
- RQ4模型是否表现出互斥性偏好,即早期词汇学习中已知的认知偏见?
- RQ5在从原始输入中进行有效的跨情境词汇学习时,是否需要对象分割?
主要发现
- Scene-CNN模型即使在场景模糊性增加的情况下,仍实现了显著高于随机水平的词-指代物映射性能,证明了从未分割的原始图像中实现跨情境学习是可能的。
- 在包含3600对匹配样本的条件下,性能仍显著高于随机水平(p < 0.01),且在不同样本下保持稳定,证实了无需对象级预处理即可实现稳健学习。
- 模型成功泛化到已学习词汇的新实例,表明所学表征支持概念层面的泛化。
- 注意力图以高精度定位了正确指代物,表明模型能够识别场景中目标词与物体之间的正确对应关系。
- 模型表现出可测量的互斥性偏好,在模糊情境下更常选择新数字,与发育研究发现一致。
- Scene-CNN在性能上优于无对象分割的基线模型,尽管仍低于Object-CNN,表明对象级归纳偏置可提升学习效率。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。