[论文解读] Can Machine Generate Traditional Chinese Poetry? A Feigenbaum Test
本文提出了一种基于注意力机制的门控循环单元(GRU)模型,通过编码主题关键词并在生成过程中关注这些关键词,以生成传统中文绝句。该模型在主题一致性与流畅性方面表现优异,通过弱化版费根鲍姆测试,使31%的机器生成诗歌被人类专家误认为是人工创作,展现出与众多当代诗人的水平相当的强劲性能。
Recent progress in neural learning demonstrated that machines can do well in regularized tasks, e.g., the game of Go. However, artistic activities such as poem generation are still widely regarded as human's special capability. In this paper, we demonstrate that a simple neural model can imitate human in some tasks of art generation. We particularly focus on traditional Chinese poetry, and show that machines can do as well as many contemporary poets and weakly pass the Feigenbaum Test, a variant of Turing test in professional domains. Our method is based on an attention-based recurrent neural network, which accepts a set of keywords as the theme and generates poems by looking at each keyword during the generation. A number of techniques are proposed to improve the model, including character vector initialization, attention to input and hybrid-style training. Compared to existing poetry generation methods, our model can generate much more theme-consistent and semantic-rich poems.
研究动机与目标
- 探究机器是否能够生成质量水平可与人类诗人相媲美的传统中文诗歌。
- 解决在神经网络诗歌生成过程中保持主题连贯性与结构规则(平仄、韵律、格式)的挑战。
- 通过特定领域的图灵测试变体——即费根鲍姆测试——评估机器生成的诗歌,重点在于专业艺术语境下专家的判断。
- 开发一种简单但高效的神经网络架构,在保持整体主题一致的同时,通过关键词条件控制实现创造性变化。
提出的方法
- 该模型采用基于门控循环单元(GRUs)的编码器-解码器架构,逐字符处理输入关键词并生成诗歌。
- 注意力机制在每个生成步骤中动态关注相关关键词,确保整首诗的主题一致性。
- 字符向量通过预训练的嵌入表示初始化,以提升语义表征与生成质量。
- 混合训练策略结合了人类创作诗歌的监督学习与对抗训练,以增强流畅性与自然度。
- 模型强制执行结构约束,如平仄模式(平/仄)、押韵格式及行长度(五字或七字),以确保符合古典中文诗歌的规则。
- 使用多样化的关键词集合,以促进生成诗歌的创新性与多样性,同时保持主题连贯性。
实验结果
研究问题
- RQ1神经网络能否生成在专家评估中与人工创作诗歌难以区分的传统中文绝句?
- RQ2机器生成的诗歌在多大程度上能保持主题连贯性并符合古典中文诗歌的结构规则?
- RQ3与基线模型相比,注意力机制是否显著提升了主题一致性和语义丰富度?
- RQ4该模型是否能弱化通过费根鲍姆测试,即让超过30%的人类专家误认为机器生成的诗歌是人工创作?
- RQ5在平均分与顶尖评分方面,机器生成诗歌的质量与人类诗人的表现相比如何?
主要发现
- 31%的机器生成诗歌被专家误判为人工创作,表明该模型弱化通过了费根鲍姆测试,达到>30%的成功阈值。
- 61.9%的机器生成诗歌获得3分或以上的质量评分(5分制),而人类诗歌为75.6%,显示其性能强劲,尽管平均分略低。
- 在评分最高的前10首诗歌中,机器生成了第1名与第2名,还获得第7名,表明其有能力创作出超越多数人类作品的诗歌。
- 专家在区分人工与机器生成诗歌时,最常依据的是流畅性与美学品质,而美学感知是导致误判的关键因素。
- 通过定性与定量评估均证实,该模型在主题一致性和语义丰富度方面显著优于先前方法。
- 注意力机制与关键词条件控制在维持主题连贯性方面至关重要,专家指出,流畅且具有美感的诗歌更可能被误认为是人工创作。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。