Skip to main content
QUICK REVIEW

[论文解读] Do Neural Language Representations Learn Physical Commonsense?

Maxwell Forbes, Ari Holtzman|arXiv (Cornell University)|Aug 8, 2019
Topic Modeling参考文献 21被引用 10
一句话总结

本文研究了像 BERT 这类最先进的神经网络语言模型是否能通过评估其从文本和视觉语境中推断物体功能与属性的能力,来学习物理常识推理。尽管在属性和功能预测任务上表现优异,但模型在推理属性与功能之间逻辑关系方面表现不佳,表明其依赖于表层关联而非因果性的物理理解。

ABSTRACT

Humans understand language based on the rich background knowledge about how the physical world works, which in turn allows us to reason about the physical world through language. In addition to the properties of objects (e.g., boats require fuel) and their affordances, i.e., the actions that are applicable to them (e.g., boats can be driven), we can also reason about if-then inferences between what properties of objects imply the kind of actions that are applicable to them (e.g., that if we can drive something then it likely requires fuel). In this paper, we investigate the extent to which state-of-the-art neural language representations, trained on a vast amount of natural language text, demonstrate physical commonsense reasoning. While recent advancements of neural language models have demonstrated strong performance on various types of natural language inference tasks, our study based on a dataset of over 200k newly collected annotations suggests that neural language representations still only learn associations that are explicitly written down.

研究动机与目标

  • 评估神经网络表征是否学习了物理常识知识,特别是关于物体属性及其功能的推理能力。
  • 探究语言模型能否从物体属性与适用动作之间的因果或逻辑关系中进行推断(例如,可驾驶物体所需的燃料)。
  • 构建并发布两个新数据集——抽象数据集与情境化数据集——标注了物体属性、功能及其相互关联,用于基准测试物理常识推理能力。
  • 评估现代上下文嵌入模型(如 BERT 和 ELMo)在超越表层统计关联的基础上推断物理常识的能力。

提出的方法

  • 基于改进版的 McRate 数据集,构建了一个包含 200,000 多个标注的抽象数据集,涵盖物体属性,具有密集标注并减少了假阴性样本。
  • 利用 MS COCO 图像创建情境化数据集,标注员针对特定物体实例标注其属性与功能,消除了模糊的“难以判断”回答。
  • 通过基于动词的界面收集功能标注,为每个物体选择前三个动词,并从未选中的动词中生成负样本。
  • 使用 Amazon Mechanical Turk 进行标注,并通过伪属性(例如,“X 是否为英文单词?”)实施质量控制,以过滤随机标注者。
  • 在数据集上端到端微调 BERT,性能优于固定模型基线。
  • 在三个任务上评估模型:物体-属性(O↔P)、物体-功能(O↔A)和功能-属性(A↔P)预测。

实验结果

研究问题

  • RQ1神经网络语言模型在多大程度上能从属性推断物体功能(A←P),例如,能否推断出船需要燃料,因为它可以被驾驶?
  • RQ2模型能否从功能推断属性(A→P),例如,能否识别出需要电力的物体必须插电?
  • RQ3模型是否学习了属性与功能之间的逻辑或因果联系,还是仅记忆了表层共现关系?
  • RQ4上下文嵌入模型(如 BERT)与静态词嵌入(如 GloVe)相比,在捕捉物理常识知识方面表现如何?
  • RQ5与纯文本输入相比,视觉定位是否能提升模型在物理常识推理方面的能力?

主要发现

  • BERT 及其他神经网络语言模型在从上下文推断物体属性和功能方面表现优异,表明其学习了大量表层关联。
  • 尽管在 O↔P 和 O↔A 任务上准确率很高,但模型在 A↔P 推理任务上表现不佳,表明其未能学习属性与功能之间的逻辑或因果关系。
  • 表现最佳的模型(微调后的 BERT)在 A↔P 任务上仍显著低于人类水平,性能远低于人类基线。
  • 基于真实图像的情境化数据集提升了标注质量,并使物理常识评估(尤其是功能预测)更加可靠。
  • 在数据收集中使用伪属性成功过滤了低质量标注者,提升了数据集的可靠性。
  • 即使经过端到端微调,BERT 仍未学会超越模式匹配的物理常识推理,表明当前自监督语言表征学习存在根本性局限。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。