Skip to main content
QUICK REVIEW

[论文解读] INSCIT: Information-Seeking Conversations with Mixed-Initiative Interactions

Zeqiu Wu, Ryu Parish|arXiv (Cornell University)|Jul 2, 2022
Topic Modeling被引用 6
一句话总结

本文介绍了INSCIT,这是一个新的开放域数据集,包含805段人类之间的信息寻求对话,具有混合主动性交互特征。在这些对话中,代理使用维基百科进行回应,提供直接答案(72%)、澄清(13%)或相关部分信息(13%)。该数据集支持两项任务——证据段落识别与响应生成——并揭示了当前最先进模型与人类表现之间的显著性能差距,凸显了多段落推理和非直接回应策略方面的挑战。

ABSTRACT

In an information-seeking conversation, a user may ask questions that are under-specified or unanswerable. An ideal agent would interact by initiating different response types according to the available knowledge sources. However, most current studies either fail to or artificially incorporate such agent-side initiative. This work presents InSCIt, a dataset for Information-Seeking Conversations with mixed-initiative Interactions. It contains 4.7K user-agent turns from 805 human-human conversations where the agent searches over Wikipedia and either directly answers, asks for clarification, or provides relevant information to address user queries. The data supports two subtasks, evidence passage identification and response generation, as well as a human evaluation protocol to assess model performance. We report results of two systems based on state-of-the-art models of conversational knowledge identification and open-domain question answering. Both systems significantly underperform humans, suggesting ample room for improvement in future studies.

研究动机与目标

  • 为解决现有数据集中缺乏真实、混合主动性信息寻求对话的问题,其中代理主动通过澄清、部分答案或相关信息引导用户。
  • 支持对话代理研究,使其能够处理表述不完整的问题、模糊信息以及来自维基百科的多份证据段落。
  • 提供一种人类评估协议,用于评估模型响应在连贯性、事实一致性以及信息全面性方面的表现。
  • 在基于维基百科的开放域多轮对话中,对当前最先进模型在段落识别与响应生成任务上的表现进行基准测试。
  • 识别在多段落证据融合与超越直接答案生成的策略性响应选择方面存在的关键挑战。

提出的方法

  • 通过可扩展的标注流程收集数据集,由人工标注者模拟用户与代理在维基百科上的自然、开放式对话。
  • 代理在维基百科中搜索以识别相关证据段落,并从三种回应策略中选择:直接答案、澄清或提供相关部分信息。
  • 定义了两项核心任务:(1)从维基百科中识别相关证据段落;(2)基于已识别的证据生成回应。
  • 设计了人类评估协议,由多名标注者依据连贯性、事实一致性和信息全面性等维度,对多种类型响应进行评估。
  • 实现了两个强基线模型:一个采用流水线式DIALKI+FiD系统进行段落检索与响应生成;另一个采用联合检索-生成模型。
  • 自动评估使用BLEU和Rouge-F1分数,人类评估则采用结构化标注方案以评估模型输出质量。

实验结果

研究问题

  • RQ1当前最先进模型在开放域、多轮信息寻求对话中识别相关维基百科段落的表现如何?
  • RQ2当证据跨越多个段落或需要非直接策略时,模型在生成连贯、事实一致且全面的回应方面能达到何种程度?
  • RQ3与仅支持直接答案的设置相比,混合主动性代理行为(如澄清或部分答案)的引入如何影响模型性能?
  • RQ4当前模型在处理模糊、表述不完整或需多证据支持的查询时,主要的失败模式是什么?
  • RQ5自动指标在预测复杂、混合主动性对话中人类对响应质量判断方面的有效性如何?

主要发现

  • 最佳表现模型(DIALKI+FiD)在给定原始证据段落和回应类型的情况下,在开发集上Rouge-F1得分为48.7,在测试集上为47.4。
  • 即使在提供原始证据和回应类型的情况下,模型的Rouge-F1(47.4)仍远低于人类表现,表明仍有巨大改进空间。
  • 性能差距在非直接回应策略(如澄清和相关部分答案)中最大,凸显了策略性回应生成的挑战。
  • 段落识别显著影响回应的连贯性,表明提升证据检索能力对改善回应质量至关重要。
  • 在保持事实一致性和信息全面性的同时,融合多份证据段落的信息仍是尚未解决的重大挑战。
  • 结果表明,当前模型在开放式、多段落推理任务中表现不佳,且在复杂信息寻求场景中无法有效采用适当的代理发起策略。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。