[论文解读] Baby Intuitions Benchmark (BIB): Discerning the goals, preferences, and actions of others
婴儿直觉基准测试(BIB)通过模拟婴儿认知实验的刺激,评估机器学习模型在推理其他代理的目标、偏好和行为方面的能力。尽管使用了先进的深度学习模型,系统仍无法复制婴儿般的推理能力,暴露出机器在意图性常识理解方面的关键差距。
To achieve human-like common sense about everyday life, machine learning systems must understand and reason about the goals, preferences, and actions of other agents in the environment. By the end of their first year of life, human infants intuitively achieve such common sense, and these cognitive achievements lay the foundation for humans' rich and complex understanding of the mental states of others. Can machines achieve generalizable, commonsense reasoning about other agents like human infants? The Baby Intuitions Benchmark (BIB) challenges machines to predict the plausibility of an agent's behavior based on the underlying causes of its actions. Because BIB's content and paradigm are adopted from developmental cognitive science, BIB allows for direct comparison between human and machine performance. Nevertheless, recently proposed, deep-learning-based agency reasoning models fail to show infant-like reasoning, leaving BIB an open challenge.
研究动机与目标
- 创建一个基准测试,以评估机器学习模型基于发展认知科学基础的刺激,推理其他代理目标、偏好和行为的能力。
- 通过采用婴儿研究中使用的相同实验范式,实现在人类婴儿与机器模型之间的直接比较。
- 通过分布外测试样本和违反预期(VOE)框架,挑战现有深度学习模型,以评估其泛化能力和类人推理能力。
- 揭示当前人工智能系统在推理意图性方面的局限性,特别是区分理性与非理性行为以及基于物体的偏好方面的能力。
- 为未来基准测试奠定基础,扩展至认知状态和现象学状态,如错误信念推理,以实现在机器中实现完整的心理理论。
提出的方法
- 采用经典婴儿认知研究中的刺激和实验范式,包括基于物体的目标、偏好和高效行动推理。
- 使用违反预期(VOE)范式,模型需判断代理行为是否符合其潜在意图,即是否合理或出人意料。
- 通过数千个二维形状在网格世界环境中移动的视频片段进行大量背景训练,以模拟从经验中学习的过程。
- 设计与训练分布不同的测试样本,衡量模型在简单模式匹配之外的泛化能力。
- 在目标导向行为、基于偏好的选择以及高效移动等任务上评估模型,以合理性判断为主要评估指标。
- 采用统一框架,使用相同的刺激和评估协议,实现人类与机器性能的直接对比。
实验结果
研究问题
- RQ1机器学习模型能否在其对代理目标和偏好的推理能力上,泛化到新颖的、分布外的测试场景?
- RQ2深度学习模型是否能在区分理性与非理性行为以及基于物体的偏好方面,复现婴儿般的推理能力?
- RQ3当代理表现出低效或与已展示偏好不一致的行为时,模型的表现如何?即面对预期违反情境时的表现如何?
- RQ4模型在多大程度上依赖于感知启发式方法(如距离近似),而非高层级的意图性推理?
- RQ5与人类婴儿仅需约8段视频即可泛化到新测试事件相比,大规模视频数据的背景训练对模型性能有何影响?
主要发现
- 基线深度学习模型始终预测代理会移动到两个物体中更近的那个,而不管其先前表现出的偏好,表明其无法推理基于物体的目标。
- 模型过度泛化了行动效率原则,将非理性或低效行为视为理性行为,而人类婴儿则能清晰区分此类行为。
- 即使代理为达到特定物体付出了更多努力,模型也未能据此推断出偏好,这是婴儿认知中的关键能力。
- 尽管经过数千个视频片段的大量训练,模型的表现仍无法与婴儿相比,而婴儿仅需约8段视频即可泛化到新测试事件。
- 该基准揭示了一个根本性断层:即使在大规模数据上进行训练,模型仍依赖低水平启发式方法而非高层级心理状态推理。
- 结果凸显了机器常识中的关键差距:当前系统缺乏将偏好与高效行动整合为对他人一致心理理论的能力。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。