[论文解读] A Large-Scale Chinese Short-Text Conversation Dataset
本文介绍了LCCC,一个大规模、高质量的中文短文本对话数据集,包含680万(基础版)和1200万(增强版)条对话,通过结合基于规则的过滤与在11万组人工标注对上训练的分类器的两阶段清洗管道进行清洗。作者发布了基于LCCC预训练的对话模型(CDialGPT),在自动评估与人工评估中表现优异,为中文开放域对话生成设立了新基准。
The advancements of neural dialogue generation models show promising results on modeling short-text conversations. However, training such models usually needs a large-scale high-quality dialogue corpus, which is hard to access. In this paper, we present a large-scale cleaned Chinese conversation dataset, LCCC, which contains a base version (6.8million dialogues) and a large version (12.0 million dialogues). The quality of our dataset is ensured by a rigorous data cleaning pipeline, which is built based on a set of rules and a classifier that is trained on manually annotated 110K dialogue pairs. We also release pre-training dialogue models which are trained on LCCC-base and LCCC-large respectively. The cleaned dataset and the pre-training models will facilitate the research of short-text conversation modeling. All the models and datasets are available at https://github.com/thu-coai/CDial-GPT.
研究动机与目标
- 为解决当前缺乏大规模、高质量中文对话数据集以用于神经对话生成模型训练的问题。
- 克服公开社交媒体语料库中存在的数据质量问题,如有害内容和低相关性。
- 开发一种可扩展的、基于规则与分类器的中文短文本对话清洗管道。
- 发布基准数据集与预训练模型,以加速中文对话生成研究。
- 通过在清洗过的中文对话上进行大规模预训练,实现开放域对话生成的最先进性能。
提出的方法
- 设计了两阶段数据清洗流程:首先应用启发式规则过滤不当内容,然后利用在11万组人工标注对话对上训练的分类器进一步提升质量。
- LCCC数据集基于7900万条微博对话构建基础版本,并通过额外的中文语料扩展为增强版本。
- 预训练模型(CDialGPT)首先在中文小说语料上进行预训练,随后使用掩码语言建模目标在LCCC数据集上进行微调。
- 模型在下游任务上通过序列到序列生成框架与自回归解码方式进行微调。
- 采用自动指标(BLEU、困惑度、不同n-gram数量、贪婪匹配、嵌入平均)与人工评估相结合的方式进行模型评估。
- 所有模型与数据集均已发布在GitHub上(https://github.com/thu-coai/CDial-GPT),供公众使用。
实验结果
研究问题
- RQ1基于规则与分类器的可扩展清洗管道是否能有效清洗大规模中文短文本对话,同时保留高质量对话样本?
- RQ2与在较小或噪声更大的数据集上训练的模型相比,在大规模、清洗过的中文对话语料上进行预训练,是否能显著提升开放域对话生成的性能?
- RQ3所发布的预训练模型(CDialGPT)在中文对话生成的自动与人工评估指标上,相较于现有基线模型,其表现提升程度如何?
- RQ4LCCC数据集是否可作为训练与评估中文对话生成模型的稳健基准?
- RQ5数据集规模与质量对生成回复的流畅性、相关性与信息量有何影响?
主要发现
- LCCC-large数据集包含1200万条高质量对话,基础版本为680万条,显著扩展了中文对话研究的可用资源。
- 两阶段清洗流程——结合基于规则的过滤与训练分类器——有效降低了噪声,生成了适合用于预训练的高质量语料。
- 在LCCC-large版本上,基于LCCC预训练的CDialGPT模型困惑度达到18.23,优于其他模型在自动与人工评估中的表现。
- 人工评估显示,CDialGPT_{LCCC-large}在2/1/0评分尺度上得分为1.217,48.6%的回复被评为高度信息丰富,表明其具有出色的流畅性与相关性。
- 尽管BLEU得分较低,CDialGPT在人工评估中仍优于Transformer与GPT2-chitchat等强基线模型,证实了数据质量在模型性能中的关键作用,而非仅依赖特定指标的优化。
- 在https://github.com/thu-coai/CDial-GPT发布数据集与模型,支持可复现研究,显著加速了中文对话生成领域的进展。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。