[论文解读] CSL: A Large-scale Chinese Scientific Literature Dataset
本论文介绍了CSL,这是首个大规模中文科学文献数据集,包含396,209篇论文,涵盖标题、文摘、关键词及学术学科。该数据集支持中文自然语言处理模型的预训练,并为摘要生成、关键词生成和分类等任务建立了基准,揭示了尽管基线性能尚可,现有模型仍面临持久挑战。
Scientific literature serves as a high-quality corpus, supporting a lot of Natural Language Processing (NLP) research. However, existing datasets are centered around the English language, which restricts the development of Chinese scientific NLP. In this work, we present CSL, a large-scale Chinese Scientific Literature dataset, which contains the titles, abstracts, keywords and academic fields of 396k papers. To our knowledge, CSL is the first scientific document dataset in Chinese. The CSL can serve as a Chinese corpus. Also, this semi-structured data is a natural annotation that can constitute many supervised NLP tasks. Based on CSL, we present a benchmark to evaluate the performance of models across scientific domain tasks, i.e., summarization, keyword generation and text classification. We analyze the behavior of existing text-to-text models on the evaluation tasks and reveal the challenges for Chinese scientific NLP tasks, which provides a valuable reference for future research. Data and code are available at https://github.com/ydli-ai/CSL
研究动机与目标
- 通过构建中文学术论文的综合性数据集,解决大规模、高质量中文科学自然语言处理资源匮乏的问题。
- 提供一个半结构化、自然标注的语料库,支持从科学元数据衍生的多种监督式自然语言处理任务。
- 为评估中文科学自然语言处理任务在真实场景下的模型表现建立基准。
- 通过微调T5模型,展示CSL作为预训练语料库的实用性,并证明其性能优于通用领域预训练模型。
- 识别中文科学自然语言处理中持续存在的挑战,并为未来研究方向提供指导。
提出的方法
- CSL数据集由来自13个一级学科类别和67个二级学科领域的综合性期刊中收集的396,209篇中文学术论文构建而成。
- 元数据包括标题、文摘、关键词、学术类别和学科,同时提供了各字段长度和分布的详细统计数据。
- 通过文本到文本任务设计了基准:摘要生成(文摘 → 标题)、关键词生成(文摘 → 关键词)和分类(文摘 → 类别/学科)。
- 作者在这些任务上对最先进的中文文本到文本模型(包括T5)进行了微调,采用单任务和多任务学习两种设置。
- 通过在论文文摘上进行领域自适应预训练,构建了CSL-T5模型,并证明其在下游任务中优于在通用领域语料上预训练的模型。
- 评估指标包括摘要生成任务的ROUGE-L和关键词生成任务的Bpref,分类任务则报告准确率。
实验结果
研究问题
- RQ1大规模、高质量的中文科学文献数据集能否有效支持自然语言处理模型的预训练与微调?
- RQ2现有文本到文本模型在中文科学自然语言处理任务(如摘要生成、关键词生成和分类)中的表现如何?
- RQ3多任务学习对不同中文科学自然语言处理任务性能的影响如何?
- RQ4与通用领域预训练相比,基于科学文摘进行领域自适应预训练在下游任务中的表现如何?
- RQ5尽管基线结果尚可,中文科学自然语言处理中仍存在哪些关键挑战?
主要发现
- 在CSL文摘上预训练的T5模型(CSL-T5)优于在通用领域语料上预训练的模型,证明了领域特定预训练的价值。
- 现有模型在中文科学自然语言处理任务中达到可接受但不令人满意的性能,表明仍有显著提升空间。
- 多任务学习略优于单任务微调,表明从同一数据集中衍生的同质任务之间存在知识迁移的可行性。
- 基准测试表明,摘要生成和关键词生成任务仍具挑战性,ROUGE-L分数和Bpref值显示模型仍有优化余地。
- 该数据集通过输入-输出组合支持广泛的自然语言处理任务,支持跨任务学习与少样本学习的探索。
- 作者确认CSL数据来源合法,无隐私或版权问题,因其使用的是政府授权学术资源中的匿名化元数据。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。