[论文解读] A Manually Annotated Chinese Corpus for Non-task-oriented Dialogue Systems
本论文提出了首个用于非任务导向对话系统的中文人工标注语料库,包含超过27,000条提示词及82,000对经过五级质量评分(差至优秀)的回复,评分维度涵盖相关性、连贯性、信息量和趣味性。该语料库在回复选择任务中实现了卓越性能,监督模型优于无监督基线模型,并在更严格的质量阈值下表现出更强的鲁棒性。
This paper presents a large-scale corpus for non-task-oriented dialogue response selection, which contains over 27K distinct prompts more than 82K responses collected from social media. To annotate this corpus, we define a 5-grade rating scheme: bad, mediocre, acceptable, good, and excellent, according to the relevance, coherence, informativeness, interestingness, and the potential to move a conversation forward. To test the validity and usefulness of the produced corpus, we compare various unsupervised and supervised models for response selection. Experimental results confirm that the proposed corpus is helpful in training response selection models.
研究动机与目标
- 解决非任务导向中文对话系统缺乏高质量人工标注训练数据的问题。
- 通过引入质量感知标注,减少训练数据中低质量、通用性回复(如“我也是”)的普遍性。
- 建立一个基准数据集,用于训练和评估中文对话系统中的回复选择模型。
- 通过在多种回复选择模型上的对比实验,验证语料库的实用性。
- 通过区分不同质量等级的回复(尤其是优秀回复与一般或多功能回复),提升对话系统的可靠性。
提出的方法
- 从百度贴吧、知乎、豆瓣和新浪微博等社交媒体平台收集了超过27,000条独立的中文提示词及82,000对回复对。
- 基于相关性、连贯性、信息量和对话潜力,定义了五级评分标准(差、一般、可接受、好、优秀)。
- 采用多名标注员进行标注,并通过Cohen’s kappa(80.0%)计算标注者间一致性,确保标注质量。
- 使用Jieba对文本进行中文分词预处理,并将数据按80%训练集、10%开发集和10%测试集进行划分。
- 评估了多种模型:无监督模型(余弦相似度、BM25)、监督模型(SVMRank、GBDT结合人工特征)以及神经网络模型(BiLSTM、CNN)用于回复排序。
- 采用精确率@1(P@1)、平均平均精度(MAP)和平均倒数排名(MRR)作为评估指标,以人工标注的黄金标准评分定义正样本/负样本回复集。
实验结果
研究问题
- RQ1是否可通过具有多级质量评分的人工标注中文语料库,提升非任务导向对话系统中的回复选择性能?
- RQ2在本语料库上训练的监督模型与无监督基线模型相比,在选择高质量回复方面表现如何?
- RQ3该语料库在多大程度上能够有效区分优秀回复与通用或无关回复?
- RQ4该语料库是否在不同质量阈值下(如评分≥3与≥5)均能支持稳健的性能表现?
- RQ5五级评分体系在捕捉回复质量细微差异方面的有效性如何?
主要发现
- 语料库包含27,000条独立提示词及82,000对提示-回复对,其中48.9%的回复被评为“可接受”(评分3级),表明多功能或上下文受限回复普遍存在。
- 35.0%的回复评分≤2.5,证实了原始社交媒体数据的噪声大且质量低。
- 监督模型(SVMRank、GBDT、BiLSTM、CNN)在所有指标上均优于无监督模型(余弦相似度、BM25),证明了该语料库在模型训练中的价值。
- 随着质量阈值提高(如从≥3提升至≥5),无监督模型性能下降更明显,而监督模型保持了更强的鲁棒性,表明其具备更优的质量判别能力。
- 该语料库可有效对回复进行排序,优秀回复的得分始终高于良好或可接受级别的回复,验证了其在高质量回复选择中的实用性。
- 标注者间一致性(Cohen’s kappa = 80.0%)证实了五级标注体系的可靠性和一致性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。