Skip to main content
QUICK REVIEW

[论文解读] Question Asking as Program Generation

Anselm Rothe, Brenden M. Lake|arXiv (Cornell University)|Nov 16, 2017
Topic Modeling参考文献 21被引用 9
一句话总结

该论文提出了一种计算模型,将人类提问视为程序生成过程,其中问题被形式化为在给定世界状态中求值为答案的正式程序。通过将问题建模为偏好信息量和简洁性的概率程序,该模型能够预测人类提问的频率,并在基于游戏的学习任务中生成新颖的、类人的问题,其在预测人类行为方面优于基线模型,且展现出超越训练数据的创造力。

ABSTRACT

A hallmark of human intelligence is the ability to ask rich, creative, and revealing questions. Here we introduce a cognitive model capable of constructing human-like questions. Our approach treats questions as formal programs that, when executed on the state of the world, output an answer. The model specifies a probability distribution over a complex, compositional space of programs, favoring concise programs that help the agent learn in the current context. We evaluate our approach by modeling the types of open-ended questions generated by humans who were attempting to learn about an ambiguous situation in a game. We find that our model predicts what questions people will ask, and can creatively produce novel questions that were not present in the training set. In addition, we compare a number of model variants, finding that both question informativeness and complexity are important for producing human-like questions.

研究动机与目标

  • 开发一种人类提问的计算模型,以捕捉自然语言询问的丰富性与创造性。
  • 将问题生成形式化为在可能问题组合空间中的概率程序合成。
  • 评估信息量与复杂度是否共同预测人类在模糊学习情境中的问题偏好。
  • 生成训练数据中不存在的、语义连贯的新颖问题,体现创造力与相关性。
  • 提供一种可预测的、关于人类开放式、目标导向提问的认知模型。

提出的方法

  • 问题被建模为正式程序,当在可能的世界状态上执行时,会返回一个答案(例如,真/假、数字、集合)。
  • 采用基于能量的模型的概率程序合成框架,根据其信息量(通过期望信息增益衡量)和复杂度(程序长度)为程序分配概率。
  • 该模型采用组合语法,支持逻辑运算、集合操作、算术运算以及对游戏状态的属性查询(例如,船的大小、颜色、位置)。
  • 通过从程序空间进行加权采样进行推理,基于答案分布相似性拒绝重复或等价的问题。
  • 通过最大化人类在基于游戏的信息搜索任务中观察到的问题的似然性来训练模型参数。
  • 通过将预测的问题频率与人类数据对比,并生成训练集中不存在的新问题,对模型进行评估。

实验结果

研究问题

  • RQ1形式化程序生成框架能否预测人类在模糊学习情境中会提出哪些问题?
  • RQ2信息量与复杂度如何共同影响人类的问题选择?
  • RQ3该模型能否生成训练数据中不存在的、语义上合理且上下文相关的全新问题?
  • RQ4该模型性能与忽略信息量、复杂度或问题类型的变体相比如何?
  • RQ5该模型在多大程度上捕捉了问题效用与认知努力之间的认知权衡?

主要发现

  • 同时结合信息量与复杂度的完整模型,其预测问题频率与人类实际频率之间的皮尔逊相关系数达到0.78,显著优于基线模型。
  • 即使在人类数据稀疏的情况下,该模型的性能依然稳健,其表现优于忽略信息量或复杂度的模型,后者相关系数分别为0.65和-0.36。
  • 该模型在四个游戏情境中成功生成了五个新颖的、类人的问题,包括复杂的多部分查询,如“蓝色和紫色的船是否接触,且红色和紫色的船不接触(或反之)?”
  • 该模型生成的问题仅在12%的时间内与人类问题语义等价,表明其具有强大的新颖性与创造性多样性。
  • 问题频率与期望信息增益(EIG)之间无显著相关性,表明复杂度及其他因素在建模人类行为时至关重要。
  • 该模型表明,语义连贯性、信息量与简洁性的结合,能产生比仅依赖单一因素的模型更准确、更具创造力的问题生成效果。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。