[论文解读] Generating Major Types of Chinese Classical Poetry in a Uniformed Framework
本文提出了一种基于统一GPT-2框架的中文古典诗歌生成方法,可生成包括诗(绝句与律诗)和词(121种常见词牌)在内的主要诗歌类型。通过将详细的格式信息整合到标准化的训练格式中,并应用形式强化的加权机制,该模型显著提升了结构准确性和连贯性,在多种诗歌体裁中实现了高质量生成,已在清华大学的 Jioge 诗歌生成系统中完成验证。
Poetry generation is an interesting research topic in the field of text generation. As one of the most valuable literary and cultural heritages of China, Chinese classical poetry is very familiar and loved by Chinese people from generation to generation. It has many particular characteristics in its language structure, ranging from form, sound to meaning, thus is regarded as an ideal testing task for text generation. In this paper, we propose a GPT-2 based uniformed framework for generating major types of Chinese classical poems. We define a unified format for formulating all types of training samples by integrating detailed form information, then present a simple form-stressed weighting method in GPT-2 to strengthen the control to the form of the generated poems, with special emphasis on those forms with longer body length. Preliminary experimental results show this enhanced model can generate Chinese classical poems of major types with high quality in both form and content, validating the effectiveness of the proposed strategy. The model has been incorporated into Jiuge, the most influential Chinese classical poetry generation system developed by Tsinghua University (Guo et al., 2019).
研究动机与目标
- 解决在多种诗歌体裁(包括诗与词)中生成结构准确的中文古典诗歌的挑战。
- 统一具有不同结构规则的多种诗歌体裁的训练数据表示方式。
- 增强GPT-2对形式约束的控制能力,尤其针对较长且结构更复杂的体裁,如律诗和较少见的词牌。
- 在诗体的结构准确性和语义连贯性之间实现高质量平衡,覆盖主要诗歌类型。
提出的方法
- 定义一种统一的数据格式,将每条训练样本中的详细格式信息(如行数、每行字数、平仄格式、对仗要求等)嵌入其中。
- 在GPT-2中引入一种形式强化的加权机制,使自回归生成过程中对与形式相关的标记注意力增强。
- 在输入序列中引入诗节分隔标记,以提升结构意识,减少格式错误。
- 在CCPC1.0数据集的834,902首诗歌上微调GPT-2,重点关注前121种词牌和主要的诗体类型。
- 使用单一模型生成多种诗歌体裁,支持对新形式的零样本或少样本迁移。
- 在清华大学领先的中文古典诗歌生成系统Jioge中验证该框架。
实验结果
研究问题
- RQ1单一统一框架能否有效生成多种主要中文古典诗歌体裁,且保持高结构保真度?
- RQ2GPT-2中的形式强化加权机制在控制复杂诗歌体裁(尤其是长篇、严格平仄或对仗规则的体裁)方面效果如何?
- RQ3在输入格式中引入诗节分隔是否能显著减少生成诗歌的结构错误?
- RQ4尽管训练数据有限,该模型能否泛化到较少见的词牌体裁?
- RQ5该模型在多种诗歌体裁中,如何在结构准确性与语义连贯性之间实现良好平衡?
主要发现
- 增强后的模型在生成词牌为“沁园春”的作品时,正确率从基线的12.0%提升至55.0%,显著改善了结构准确性。
- 在训练格式中引入诗节分隔后,生成词作中的格式错误减少了约20%,且所有由增强模型生成的作品均符合预期格式。
- 该模型成功生成了高质量、语义连贯的各类主要诗体与词体作品,包括七言律诗与满江红,且在律诗中正确运用了对仗(Duizhang)规则。
- 通过定性案例研究验证了模型性能,显示生成作品在语义结构、主题连贯性与艺术表达方面均表现恰当。
- 该框架已成功集成至清华大学最具影响力的中文古典诗歌生成系统Jioge中,证实了其实际应用价值。
- 尽管性能有所提升,长篇体裁与低资源词牌的形式控制仍具挑战,表明在结构建模方面仍有进一步优化空间。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。