[论文解读] Modeling question asking using neural program generation
本文提出了一种神经符号框架,通过使用基于Transformer的编码器-解码器网络,采用监督学习或强化学习进行训练,将人类提问行为建模为形式化程序,以生成代表问题的正式程序。该方法在未使用人类标注问题数据的情况下,通过强化学习训练,能够生成多样化、高信息增益的问题,其表现与人类提问的创造力和结构相匹配。
People ask questions that are far richer, more informative, and more creative than current AI systems. We propose a neuro-symbolic framework for modeling human question asking, which represents questions as formal programs and generates programs with an encoder-decoder based deep neural network. From extensive experiments using an information-search game, we show that our method can predict which questions humans are likely to ask in unconstrained settings. We also propose a novel grammar-based question generation framework trained with reinforcement learning, which is able to generate creative questions without supervised human data.
研究动机与目标
- 在仅部分状态信息可用的信息搜索任务(如战舰游戏)中,建模人类提问行为。
- 解决数据驱动的神经问题生成模型的局限性,这些模型缺乏多样性与创造力,且需要大规模标注数据集。
- 开发一种将问题表示为形式化程序的框架,以实现组合性、可解释性及语义精确的问题合成。
- 通过强化学习在无需人类标注问题数据的情况下训练模型,同时生成反映人类提问模式的问题。
- 在预测准确性(密度估计)和新颖、信息量高的问题创造性生成两个方面对模型进行评估。
提出的方法
- 将问题表示为领域特定语言(DSL)中的形式化程序,以实现精确、组合性及可解释的问题生成。
- 使用卷积神经网络(CNN)编码器将部分可观测的游戏状态编码为密集表示。
- 采用Transformer解码器以逐标记的方式生成问题程序,条件依赖于编码后的状态。
- 在预训练阶段使用自动生成的问题后,采用少量人类标注问题以监督方式训练模型。
- 采用基于期望信息增益(EIG)的奖励函数的强化学习方法,无需人类问题标注即可训练模型。
- 引入语法引导的解码策略,通过从特定非终结符符号初始化解码过程,实现对特定问题类型(如真假题、数值题、基于位置的问题)的条件生成。
实验结果
研究问题
- RQ1神经程序生成模型能否在无约束、部分可观测的环境中预测人类可能提出的问题?
- RQ2基于强化学习的方法能否在不依赖人类标注问题数据的情况下,生成具有创造力且类人的问题?
- RQ3模型生成的问题在结构、多样性和信息含量方面与人类问题的匹配程度如何?
- RQ4与自然语言生成相比,使用程序表示在提升生成问题的可解释性与质量方面有何优势?
- RQ5通过条件化解码过程,模型能否灵活生成不同类型的问题(如真假题、复合问题)?
主要发现
- 强化学习模型生成的问题平均期望信息增益(EIG)为0.924,表明其具有高度的信息量,尽管未使用人类演示数据。
- 未使用步长惩罚的RL模型在多样性与EIG方面表现最佳(92.4%的问题EIG > 0),但同时也产生了大量无意义问题。
- 在步长惩罚为0.2时,RL模型平均生成5.79个标记,且与人类提问模式高度一致,尤其在船的大小与方向方面表现突出。
- RL模型与人类生成的最常见10个问题高度相似,均倾向于关注船的大小与方向。
- 模型生成了新颖且具创造性的提问,如“蓝色船与紫色船的大小之和是多少?”以及“所有蓝色与紫色方块的右下角方块在哪里?”,展示了组合性创造力。
- 语法引导的解码使模型能够按需生成特定问题类型(如真假题、数值题、位置题),展现出与人类提问相似的灵活性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。