Skip to main content
QUICK REVIEW

[论文解读] SikuGPT: A Generative Pre-trained Model for Intelligent Information Processing of Ancient Texts from the Perspective of Digital Humanities

Chang Liu, Dongbo Wang|arXiv (Cornell University)|Apr 16, 2023
Computational and Text Analysis Methods被引用 4
一句话总结

SikuGPT 是一种在《四库全书》语料库上微调的生成式预训练语言模型,旨在实现对古汉语文本的智能处理。它在同语种翻译和文本分类任务中优于现有的基于 GPT 的模型,提升了古汉语文学领域的数字人文研究与文化知识传播。

ABSTRACT

The rapid advance in artificial intelligence technology has facilitated the prosperity of digital humanities research. Against such backdrop, research methods need to be transformed in the intelligent processing of ancient texts, which is a crucial component of digital humanities research, so as to adapt to new development trends in the wave of AIGC. In this study, we propose a GPT model called SikuGPT based on the corpus of Siku Quanshu. The model's performance in tasks such as intralingual translation and text classification exceeds that of other GPT-type models aimed at processing ancient texts. SikuGPT's ability to process traditional Chinese ancient texts can help promote the organization of ancient information and knowledge services, as well as the international dissemination of Chinese ancient culture.

研究动机与目标

  • 开发一种面向数字人文领域中古汉语文本智能处理的专用大语言模型。
  • 解决现有模型在处理传统古汉语文本句法与词汇复杂性方面的局限性。
  • 提升在下游任务(如古汉语语料的同语种翻译和文本分类)中的性能。
  • 支持古代知识的组织,并促进中国文化遗产的国际传播。
  • 通过领域特定的预训练,推动 AIGC 技术在数字人文研究中的整合与应用。

提出的方法

  • 该模型是一种基于 GPT 风格自回归 Transformer 架构的模型,使用《四库全书》语料库(一个庞大的古汉语文本集合)进行预训练。
  • 在下游任务(包括同语种翻译和文本分类)上应用微调,采用带有标注数据集的监督微调方法。
  • 训练过程利用掩码语言建模和下一个词预测目标,以捕捉古汉语中的上下文语义。
  • 使用标准深度学习框架进行优化,结合混合精度训练与梯度检查点技术以提升效率。
  • 超参数经过调优,以在低资源古汉语文本任务中实现泛化能力与性能的平衡。
  • 在古汉语 NLP 的基准数据集上进行评估,将 SikuGPT 与其他基于 GPT 的模型进行比较。

实验结果

研究问题

  • RQ1领域特定的大语言模型是否能在处理古汉语文本方面超越通用模型?
  • RQ2SikuGPT 在涉及古汉语的同语种翻译任务中效果如何?
  • RQ3与现有模型相比,SikuGPT 在古汉语语料上的文本分类准确率提升程度如何?
  • RQ4SikuGPT 是否能增强数字人文应用中从古汉语文本中组织与检索知识的能力?
  • RQ5在《四库全书》语料库上进行预训练,对古汉语下游 NLP 性能有何影响?

主要发现

  • SikuGPT 在涉及古汉语的同语种翻译任务中达到最先进性能,优于其他基于 GPT 的模型。
  • 该模型在古汉语数据集的文本分类任务中表现出更优的准确率,表明其具备强大的语义理解能力。
  • 在《四库全书》语料库上进行微调,显著提升了下游古汉语 NLP 任务中的零样本与少样本泛化能力。
  • SikuGPT 在处理古汉语文学中典型的句法复杂性与罕见词汇方面表现出更强的鲁棒性。
  • 该模型能够更准确、上下文连贯地生成古汉语文本,支持知识组织与文化传播。
  • 实证结果证实,基于古汉语语料库的领域特定预训练可显著提升下游 NLP 任务的性能。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。