[论文解读] Deep daxes: Mutual exclusivity arises through both learning biases and pragmatic strategies in neural networks
该论文表明,通过学习偏差(例如最大间隔损失)或语用性参照选择策略,神经网络中可以涌现出词汇学习中的互斥性——即新词与新参照物之间的关联。尤其当词汇和对象的区分度增强时,这种现象更为显著。在视觉数据上,反多义性约束通过提升对象的可区分性,显著改善了性能,表明结构化的刺激复杂性对学习结果具有决定性影响。
Children's tendency to associate novel words with novel referents has been taken to reflect a bias toward mutual exclusivity. This tendency may be advantageous both as (1) an ad-hoc referent selection heuristic to single out referents lacking a label and as (2) an organizing principle of lexical acquisition. This paper investigates under which circumstances cross-situational neural models can come to exhibit analogous behavior to children, focusing on these two possibilities and their interaction. To this end, we evaluate neural networks' on both symbolic data and, as a first, on large-scale image data. We find that constraints in both learning and selection can foster mutual exclusivity, as long as they put words in competition for lexical meaning. For computational models, these findings clarify the role of available options for better performance in tasks where mutual exclusivity is advantageous. For cognitive research, they highlight latent interactions between word learning, referent selection mechanisms, and the structure of stimuli of varying complexity: symbolic and visual.
研究动机与目标
- 探究神经网络在何种条件下能够表现出互斥性,以模仿儿童的词汇学习行为。
- 厘清学习偏差(例如损失函数)与语用性参照选择策略在促进互斥性中的作用。
- 评估互斥性在符号性数据与大规模视觉数据集(包含自然物体共现)中是否更有效地涌现。
- 将互斥性形式化为贝叶斯推理过程,将其与概率性语用模型相联系。
- 评估对同义性与多义性的约束如何影响跨情境词汇学习任务中的性能。
提出的方法
- 作者在跨情境词汇学习任务上训练神经网络,使用符号性数据和大规模图像数据。
- 对词-对象对应用最大间隔损失,以强制正负参照物之间的分离,促进反同义性。
- 引入联合损失目标,结合词级与对象级的最大间隔约束,以同时提升词与对象的可区分性。
- 使用贝叶斯推理评估模型的参照物选择,建模新词理解中的语用推理。
- 比较不同损失配置(例如仅词、仅对象、联合)的性能,并分析30次独立初始化实验中的方差。
- 使用预训练的视觉嵌入以稳定训练,并隔离对象级区分度的影响。
实验结果
研究问题
- RQ1神经网络是否能在新词理解中表现出互斥性?在何种条件下这种现象会涌现?
- RQ2学习偏差(例如最大间隔损失)还是语用性参照选择策略更能支持互斥性?
- RQ3刺激结构(符号性 vs. 视觉)如何影响互斥性机制的有效性?
- RQ4通过反多义性提升对象可区分性在视觉词汇学习任务中在多大程度上能增强性能?
- RQ5同时约束词与对象表征的联合学习目标,与单一目标方法相比表现如何?
主要发现
- 在视觉数据上,使用词与对象联合最大间隔损失训练的模型,在新参照物上的平均准确率达到0.79,显著优于0.45的随机基线。
- 仅使用对象级最大间隔损失的模型性能有所提升(平均准确率0.59),优于仅使用词级损失的模型(0.54),表明对象可区分性有助于提升互斥性。
- 反多义性的成功依赖于对象可区分性,而由于视觉数据中对象间视觉相似性更高,这种可区分性在视觉数据中比在符号性数据中更为关键。
- 仅采用反同义性(词级损失)的模型在实验中表现出较高方差,这是由于新词嵌入的随机初始化所致,凸显了缺乏额外约束时的不稳定性。
- 联合目标优于单一目标,表明同时提升词与对象区分度对于实现稳健的互斥性至关重要。
- 结果表明,互斥性可在具有连续表征的大规模神经网络中实现,挑战了以往认为此类行为需专用架构的假设。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。