[论文解读] Interview: A Large-Scale Open-Source Corpus of Media Dialog
本文介绍了Interview,一个大规模(105K通话语料,1.27亿词)的开源媒体对话语料库,源自NPR新闻访谈,包含说话人角色标注。在Interview上微调的模型在零样本设定下于口语对话基准测试中表现更优,且在角色条件输入下生成更具探究性、话题相关性的回复,其在响应质量与角色感知生成方面均优于无角色感知的基线模型。
Existing conversational datasets consist either of written proxies for dialog or small-scale transcriptions of natural speech. We introduce 'Interview': a large-scale (105K conversations) media dialog dataset collected from news interview transcripts. Compared to existing large-scale proxies for conversational data, language models trained on our dataset exhibit better zero-shot out-of-domain performance on existing spoken dialog datasets, demonstrating its usefulness in modeling real-world conversations. 'Interview' contains speaker role annotations for each turn, facilitating the development of engaging, responsive dialog systems. In fact, experiments on two dialog tasks show that leveraging such labels improves performance over strong speaker-agnostic baselines, and enabling models to generate more specific and inquisitive responses in interview-style conversations.
研究动机与目标
- 为解决缺乏大规模、高质量、基于真实口语媒体对话的开放域对话数据集的问题。
- 探究说话人角色标注是否能提升开放域对话系统中的响应生成质量与角色感知建模能力。
- 在两个任务上对数据集进行基准测试:角色条件对话生成与说话人角色转换检测。
- 证明建模说话人角色可使访谈风格对话中的响应更自然、更具探究性,并与上下文保持更强的相关性。
提出的方法
- 该语料库基于7个NPR节目(1999–2019年)的105,848段多说话人访谈转录稿构建,共包含320万次对话轮次与1.27亿词。
- 每个话语均明确标注说话人角色(如主持人、嘉宾、嘉宾2等),支持角色感知建模。
- 在对话生成任务中,使用对话历史与说话人嵌入拼接的方式,对GPT-2与DialoGPT进行微调,引入说话人角色条件。
- 在角色转换检测任务中,使用对话历史(含与不含说话人标签)对BERT进行微调,以分类下一轮对话是否发生说话人角色转换。
- 通过自动指标(BLEU、困惑度、名词短语重叠率)与李克特量表的人工评估对模型性能进行评估。
- 说话人角色嵌入在训练过程中端到端学习,无需外部语料支持,以捕捉与角色相关的词汇与句法模式。
实验结果
研究问题
- RQ1一个包含说话人角色标注的大规模、开放域媒体对话语料库,能否提升在口语对话基准上的零样本泛化能力?
- RQ2在说话人角色条件输入下,语言模型是否能生成更具探究性、上下文相关性更强且更高质量的响应?
- RQ3说话人角色标注在多大程度上提升了实时对话中角色转换检测任务的性能?
- RQ4说话人角色建模如何影响生成响应的主题连贯性与实体指代准确性?
主要发现
- 在Interview上微调的模型相较于在Reddit等书面代理数据集上训练的模型,在现有口语对话数据集(如DailyDialog、CALLHOME)上实现了显著更优的零样本性能。
- 角色条件模型(如Speaker GPT2)的提问率高达59.4%,显著高于无角色感知基线模型,表现出更强的探究性。
- 角色条件模型的困惑度降低15.2%,BLEU得分提高4.3分,表明其响应质量与流畅性更优。
- 引入说话人角色标签后,角色转换检测的F1分数从63.2%提升至66.1%,证明角色信息对结构化对话理解具有实用价值。
- 人工评估显示,62.5%的受试者更偏好角色条件模型的输出,表明其响应更具自然感与参与感。
- 角色条件模型表现出更高的主题连贯性,其生成响应中与对话历史主题重叠的名词短语比例比基线高出32.6%。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。