[论文解读] Learning to Explain: Answering Why-Questions via Rephrasing
本文提出了一种序列到序列模型,通过在从文本中依赖解析得到的'因为'从句中自动收集的现象-解释配对上进行训练,生成开放领域因果问题的自然语言解释。该方法生成的人工评分解释在流畅性和可信度方面表现良好,在无需人工整理知识库的情况下,优于基线模型,能够生成连贯且上下文感知的解释。
Providing plausible responses to why questions is a challenging but critical goal for language based human-machine interaction. Explanations are challenging in that they require many different forms of abstract knowledge and reasoning. Previous work has either relied on human-curated structured knowledge bases or detailed domain representation to generate satisfactory explanations. They are also often limited to ranking pre-existing explanation choices. In our work, we contribute to the under-explored area of generating natural language explanations for general phenomena. We automatically collect large datasets of explanation-phenomenon pairs which allow us to train sequence-to-sequence models to generate natural language explanations. We compare different training strategies and evaluate their performance using both automatic scores and human ratings. We demonstrate that our strategy is sufficient to generate highly plausible explanations for general open-domain phenomena compared to other models trained on different datasets.
研究动机与目标
- 为解决开放领域因果问题生成自然、流畅且可信解释的挑战,超越对预存解释进行排序的模式。
- 克服现有聊天机器人数据集中因数据稀疏性导致模型无法有效回答'为什么'问题的局限。
- 开发一种可扩展的端到端解释生成方法,使用在自动构建数据集上训练的神经序列到序列模型。
- 通过将'为什么'问题重写为陈述句形式,输入至解释生成器,使模型能够作为单轮闲聊聊天机器人运行。
- 通过自动指标和人工评估(语法正确性、可信度、帮助性)来评估生成解释的质量。
提出的方法
- 通过Stanford CoreNLP进行依存句法解析,从包含'因为'的句子中提取现象-解释配对,将其拆分为S1(现象)和S2(解释)。
- 通过收集上下文(现象前的五个句子)并使用<SEP>标记将其与S1连接,构建新的自解释数据集,作为模型的输入序列。
- 将模型训练为序列到序列任务:给定C1,...,C5 <SEP> S1,预测S2作为解释。
- 提出一种新算法(算法1),通过从依存句法解析中提取主语、助动词和动词成分,将'为什么'问题转换为S1风格的陈述句。
- 模型采用基于Transformer的架构(L2E-Seq2Seq),并与基于LSTM的模型及在其他数据集上微调的语言模型进行比较。
- 通过Amazon Mechanical Turk进行人工评估,参与者对生成的解释在语法正确性、可信度、帮助性和相关性方面进行评分。
实验结果
研究问题
- RQ1神经序列到序列模型能否在不依赖人工整理知识库的情况下,为开放领域因果问题生成流畅且可信的自然语言解释?
- RQ2在现象前加入五个上下文句子是否能提升生成解释的主题相关性和质量?
- RQ3在自动提取的'因为'从句对上进行训练的模型,能否泛化到生成人类评分可信的解释?
- RQ4在人工评分的解释质量与流畅性方面,所提模型与基线模型相比表现如何?
- RQ5该模型在多大程度上可被适配为单轮闲聊聊天机器人,以回答'为什么'问题?
主要发现
- L2E-Seq2Seq模型在人工评分语法正确性方面得分为0.738(95%置信区间:0.70–0.77),优于原始解释(0.684)。
- 在整体可信度方面,模型得分为0.543(95%置信区间:0.50–0.59),低于原始解释(0.710),但仍高于中性阈值0.5。
- 人工评估显示,模型生成的解释在帮助性方面得分为0.512,高于原始解释(0.696),表明其在对话系统中具备实际部署潜力。
- 人工评估者认为,生成的解释在语法正确性方面优于原始解释,表明尽管可信度评分较低,但其流畅性有所提升。
- 该模型在生成上下文相关且自然流畅的解释方面,优于基线语言模型(如LM-1B)及其他在不同数据集上训练的Seq2Seq模型。
- 本研究证实,基于从'因为'从句中自动收集的自解释进行训练,可使模型生成可信的解释,但尚未达到人类水平的质量。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。