[论文解读] Deep-speare: A Joint Neural Model of Poetic Language, Meter and Rhyme
本文提出 Deep-speare,一种联合神经模型,通过统一架构联合生成莎士比亚十四行诗的诗意语言、格律与押韵。尽管在押韵和格律方面表现优异——生成的诗歌几乎与人类作品无法区分——但专家评估显示,机器生成的诗歌在可读性和情感冲击力方面仍表现欠佳,表明未来工作应更注重诗歌的内在内涵而非形式约束。
In this paper, we propose a joint architecture that captures language, rhyme and meter for sonnet modelling. We assess the quality of generated poems using crowd and expert judgements. The stress and rhyme models perform very well, as generated poems are largely indistinguishable from human-written poems. Expert evaluation, however, reveals that a vanilla language model captures meter implicitly, and that machine-generated poems still underperform in terms of readability and emotion. Our research shows the importance expert evaluation for poetry generation, and that future research should look beyond rhyme/meter and focus on poetic language.
研究动机与目标
- 开发一种联合神经模型,同时捕捉诗意语言、格律与押韵,用于十四行诗生成。
- 通过众包工作者与专家评估,衡量生成诗歌的质量。
- 探究显式建模格律与押韵是否能显著提升诗歌质量,超越普通语言模型的能力。
- 评估以形式为重点的模型是否损害生成诗歌的可读性与情感深度。
- 发布一个全新的十四行诗数据集与完整源代码,以支持可复现性与未来研究。
提出的方法
- 提出一种联合架构,结合语言模型与独立的重音(格律)和押韵预测模块。
- 在从 Project Gutenberg 提取的新型十四行诗语料库上端到端训练模型,使用结构与词汇约束。
- 采用字符级语言模型结合注意力机制,生成具有指定重音与押韵模式的诗句。
- 采用联合优化目标,在生成过程中强制实现正确的抑扬五步格律与 ABAB/CDCD/EFEF/GG 押韵格式。
- 利用来自背景诗歌语料库的预训练词嵌入,提升语言建模能力。
- 采用多阶段生成流程:首先预测重音音节,然后生成押韵词对,最后组合成语义连贯的完整诗句。
实验结果
研究问题
- RQ1联合神经模型能否有效生成既保持正确抑扬五步格律与押韵格式,又具备诗意连贯性的十四行诗?
- RQ2众包工作者如何判断机器生成的十四行诗是否像人类所作?他们依赖哪些特征(如押韵、格律)?
- RQ3专家评估在多大程度上揭示了众包判断所忽略的机器生成诗歌的局限性?
- RQ4与普通语言模型相比,显式建模格律与押韵是否显著提升了诗歌质量?
- RQ5专注于形式约束(格律与押韵)是否会负面影响生成诗歌的可读性与情感深度?
主要发现
- 重音与押韵模型表现极为出色,众包工作者认为生成的诗节几乎与人类作品无法区分。
- 当使用完整模型(LM∗∗+PM+RM)时,众包工作者在识别人类所作诗歌上的准确率为 53.2%,表明在形式与风格上具有高度类人特征。
- 专家评估显示,完整模型在押韵方面得分为 4.43/5.0,在格律方面得分为 4.10/5.0——略高于人类诗人,证明其形式准确性极强。
- 尽管形式约束遵守良好,完整模型在可读性方面仅得 2.70/5.0,在情感表达方面仅得 2.90/5.0,显著低于人类诗歌(分别为 4.80 与 4.37)。
- 普通语言模型(LM)在格律方面得分为 4.00/5.0,表明其无需显式建模即可隐式学习抑扬五步格律,挑战了专门设置格律模块的必要性。
- 不包含格律组件的模型(LM∗∗+RM)在众包工作者中取得相同的准确率(0.532),表明押韵是普通人判断中的主导线索,而格律在非专业评估中常被忽略。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。