[论文解读] Mutual exclusivity as a challenge for deep neural networks
本文研究了原始深度神经网络是否表现出人类儿童常见的互斥性(ME)偏差——即新颖标签更倾向于映射到新物体而非熟悉物体。作者证明,标准神经网络缺乏这种偏差,反而表现出反ME倾向,即将新输入映射到熟悉输出,这在持续学习场景中损害了样本效率。
Strong inductive biases allow children to learn in fast and adaptable ways. Children use the mutual exclusivity (ME) bias to help disambiguate how words map to referents, assuming that if an object has one label then it does not need another. In this paper, we investigate whether or not standard neural architectures have an ME bias, demonstrating that they lack this learning assumption. Moreover, we show that their inductive biases are poorly matched to lifelong learning formulations of classification and translation. We demonstrate that there is a compelling case for designing neural networks that reason by mutual exclusivity, which remains an open challenge.
研究动机与目标
- 探究原始深度神经网络在单词学习过程中是否自然表现出人类儿童中观察到的互斥性(ME)偏差。
- 评估ME偏差在持续学习场景中的益处,特别是在物体识别和机器翻译任务中。
- 识别标准神经网络的归纳偏差与持续、数据稀缺学习环境结构需求之间的不匹配。
- 主张设计能够通过互斥性学习以提升样本效率和泛化能力的任务通用神经网络。
- 探索在深度学习系统中嵌入ME作为元策略的可行性,而非依赖任务特定或显式训练。
提出的方法
- 在已知和新颖物体-标签对的合成单词学习任务上训练前馈神经网络和序列到序列(seq2seq)神经网络。
- 通过呈现一个新标签(例如,'dax')并测量网络在已知和新颖指代对象之间的输出分布来评估ME行为。
- 计算ME得分以量化模型将新标签分配给新物体而非熟悉物体的偏好程度。
- 在各种正则化器(如dropout、权重衰减)下测试模型,以评估其是否能缓解反ME偏差。
- 在新类别逐步出现的持续学习设置下分析性能,以模拟现实世界的持续学习。
- 将模型行为与将ME视为先天或习得的认知发展理论进行比较,以评估其与人类学习的一致性。
实验结果
研究问题
- RQ1原始深度神经网络在一次学习单词时是否表现出互斥性(ME)偏差?
- RQ2标准神经网络架构和训练范式在需要新类别分配的持续学习场景中表现如何?
- RQ3互斥性偏差是否有助于提升物体识别和机器翻译任务中的样本效率?
- RQ4能否设计神经网络以根据任务需求自主应用或抑制ME偏差?
- RQ5在神经网络中观察到的反ME偏差对学习罕见或分布外样本有何影响?
主要发现
- 原始深度神经网络不表现出互斥性(ME)偏差;相反,它们表现出强烈的反ME偏差,倾向于将新输入映射到熟悉输出。
- 即使使用dropout和权重衰减等常见正则化器,神经网络仍无法发展或采用ME偏差,表明其在标准训练下并非一种可学习的归纳偏差。
- 反ME偏差导致在新类别频繁出现的持续学习环境中表现不佳,因为模型会持续将新标签错误地分配给熟悉类别。
- 缺乏ME推理会损害样本效率,尤其是在少样本或零样本学习中,模型难以泛化到罕见或未见过的类别。
- 在合成ME任务上训练的神经网络可以学习互斥性,但仅当显式为此设计时才有效——这种能力无法推广到通用模型。
- 结果表明,当前深度学习模型与现实世界学习的结构假设不一致,即新刺激应优先与新指代物关联。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。