Skip to main content
QUICK REVIEW

[论文解读] Towards Understanding How Machines Can Learn Causal Overhypotheses

Eliza Kosoy, David M. Chan|arXiv (Cornell University)|Jun 16, 2022
Bayesian Modeling and Causal Inference被引用 10
一句话总结

本文引入了一个bliket检测器环境作为基准,用于评估机器学习模型如何学习因果超假设——即关于因果结构的抽象、可迁移的假设,如合取或析取关系。尽管在标准任务上表现强劲,但最先进的模型(如深度强化学习、行为克隆和大语言模型,例如PaLM、GPT-3)在没有明确假设的情况下,尤其在零样本或少样本设置中,难以有效泛化或推理,凸显了人工智能智能体在因果推理方面与儿童相比存在关键差距。

ABSTRACT

Recent work in machine learning and cognitive science has suggested that understanding causal information is essential to the development of intelligence. The extensive literature in cognitive science using the ``blicket detector'' environment shows that children are adept at many kinds of causal inference and learning. We propose to adapt that environment for machine learning agents. One of the key challenges for current machine learning algorithms is modeling and understanding causal overhypotheses: transferable abstract hypotheses about sets of causal relationships. In contrast, even young children spontaneously learn and use causal overhypotheses. In this work, we present a new benchmark -- a flexible environment which allows for the evaluation of existing techniques under variable causal overhypotheses -- and demonstrate that many existing state-of-the-art methods have trouble generalizing in this environment. The code and resources for this benchmark are available at https://github.com/CannyLab/casual_overhypotheses.

研究动机与目标

  • 开发一个基准环境,用于评估机器学习模型学习并应用因果超假设的能力——即关于因果结构的抽象、可迁移的假设。
  • 探究为何当前最先进模型在标准任务表现良好,却在分布外设置下难以泛化。
  • 将机器学习智能体在因果超假设学习上的表现与人类儿童进行对比,儿童能从极少数据中快速推断出此类超假设。
  • 识别现有方法在探索、假设生成和不确定性推理方面的局限性,尤其是在因果结构未被给出时。
  • 提供可复现的基准,包含代码和数据,以推动因果表征学习与系统性泛化研究的发展。

提出的方法

  • 改编认知科学中的bliket检测器环境,其中物体仅在特定因果组合下触发机器亮起(例如合取或析取关系)。
  • 设计任务,要求智能体基于稀疏观察推断因果关系是合取型(两者均需)还是析取型(任一即可)的。
  • 在零样本和少样本设置下,评估三类模型:深度强化学习(如Decision Transformer)、行为克隆和大语言模型(GPT-3、PaLM)。
  • 对语言模型使用自由文本提示和少样本提示,无论是否提供关于因果结构的先验假设。
  • 衡量因果结构推断性能和探索行为,与Kosoy等人(2022)中儿童的表现进行比较。
  • 在https://github.com/CannyLab/casual_overhypotheses提供灵活、开源的基准,以支持可复现的评估。

实验结果

研究问题

  • RQ1机器学习模型能否在无显式监督的情况下,仅从最少的观测数据中推断出因果超假设(如合取或析取结构)?
  • RQ2当未提供超假设时,深度强化学习和模仿学习智能体在探索和泛化到新因果结构方面表现如何?
  • RQ3在仅提供观测数据且无先验假设的情况下,大语言模型(如PaLM、GPT-3)在因果结构推理方面的能力有多大?
  • RQ4为何当前模型无法像儿童那样,仅通过几次试验就迅速学习并应用因果超假设?
  • RQ5显式建模因果超假设是否能提升强化学习智能体在探索和泛化方面的能力?

主要发现

  • 深度强化学习智能体(包括Decision Transformer)在未提供因果超假设时探索不足,且无法泛化到未见环境。
  • 大语言模型(如PaLM和GPT-3)仅在提供显式因果结构假设时才能达到高准确率(例如2/2正确),但在仅从数据中推断结构时则失败。
  • 在“未提供假设”条件下,PaLM在析取任务中正确率为0/1,在合取任务中为1/2,表明其在无监督条件下结构推断能力极弱。
  • 即使拥有完整的训练数据和示例,语言模型在未提供假设时仍难以表达不确定性或正确推断因果结构,表明其缺乏因果推理能力。
  • 相比之下,儿童能迅速学习超假设,并利用其在仅几次观察后探索并推断因果结构,表现优于当前模型。
  • 该基准揭示了因果推理中的关键差距:当前模型缺乏生成并利用抽象因果超假设以实现有效探索和泛化的能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。