Skip to main content
QUICK REVIEW

[论文解读] Analyzing Language Learned by an Active Question Answering Agent

Christian Buck, Jannis Bulian|arXiv (Cornell University)|Jan 23, 2018
Topic Modeling参考文献 12被引用 3
一句话总结

本文研究了通过强化学习训练的主动问答智能体在与黑箱问答系统交互时,如何通过调整语言以提升回答质量。该智能体学会生成较不流畅、更接近信息检索(IR)风格的改写问题——强调术语重加权、词干化和重复使用,表明其有效重新发现了经典的信息检索技术,而非采用自然语言的流畅性。

ABSTRACT

We analyze the language learned by an agent trained with reinforcement learning as a component of the ActiveQA system [Buck et al., 2017]. In ActiveQA, question answering is framed as a reinforcement learning task in which an agent sits between the user and a black box question-answering system. The agent learns to reformulate the user's questions to elicit the optimal answers. It probes the system with many versions of a question that are generated via a sequence-to-sequence question reformulation model, then aggregates the returned evidence to find the best answer. This process is an instance of \emph{machine-machine} communication. The question reformulation model must adapt its language to increase the quality of the answers returned, matching the language of the question answering system. We find that the agent does not learn transformations that align with semantic intuitions but discovers through learning classical information retrieval techniques such as tf-idf re-weighting and stemming.

研究动机与目标

  • 理解通过强化学习训练的主动问答智能体中语言的演化过程。
  • 探究该智能体是否学习人类自然语言,或采用其他语言策略以提升性能。
  • 确定该智能体的改写形式在多大程度上反映了经典信息检索技术。
  • 评估在问答系统中机器与机器通信时,流畅性与有效性之间的角色。

提出的方法

  • 该智能体使用基于策略梯度强化学习训练的序列到序列问题改写模型,以优化黑箱问答系统返回答案的F1得分。
  • 改写器生成多个问题变体,由答案排序模型评分并选择最佳候选。
  • 系统在SearchQA数据集上进行评估,其中原始的Jeopardy!提示被预处理为类似关键词的查询。
  • 使用预训练语言模型的每标记负对数似然来衡量语言流畅度。
  • 分析原始问题、基础NMT改写和AQA生成改写中的词频(TF)、文档频率(DF)及形态变化(词干化)。
  • 统计分析(t检验)确认了不同改写类型之间语言特征的显著差异。

实验结果

研究问题

  • RQ1通过强化学习训练的主动问答智能体所使用的语言与自然语言以及初始改写模型相比有何不同?
  • RQ2该智能体的改写在多大程度上反映了经典信息检索技术,如tf-idf重加权和词干化?
  • RQ3为何该智能体更倾向于使用不流畅、重复或形态简化的表达,而非流畅、语法正确的提问?
  • RQ4奖励函数中缺乏对流畅性的激励,是否导致智能体发现类似信息检索的策略而非自然语言?
  • RQ5该智能体问题的表面形式如何与现代深度问答模型(如BiDAF)的内部机制相关联?

主要发现

  • AQA智能体的改写形式显著不如原始SearchQA问题和基础NMT改写流畅,表现为语言模型概率更低(负对数似然更高)。
  • 尽管流畅性降低,AQA的最佳假设在测试集上比原始SearchQA问题高出2%的绝对F1得分,表明其有效性得到提升。
  • 99.8%的AQA生成改写以'What is name'开头,该模式在原始问题和基础NMT问题中均不存在,表明其学习到一种针对命名实体的策略。
  • AQA改写中形态变体的比例为12.5%,且共享相同词干的词数是SearchQA的两倍,表明其表现出系统性的词干化行为。
  • 该智能体通过重复提高词频(平均TF为1.2),并偏好低文档频率(DF)的术语,与tf-idf重加权原则一致。
  • 该智能体学会生成语义上无意义的表面变体(例如,'densey'来自'dense'),但这些变体可能仍能被BiDAF等基于字符编码器的模型有效处理。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。