Skip to main content
QUICK REVIEW

[论文解读] Improving Chinese Story Generation via Awareness of Syntactic Dependencies and Semantics

Henglin Huang, Chen Tang|arXiv (Cornell University)|Oct 19, 2022
Topic Modeling被引用 7
一句话总结

本文提出了一种新颖的中文故事生成框架,通过依赖性标注和同义词去噪训练,增强句法依存解析与语义表征学习。通过将这些模块与基于LongLM的生成器结合,该模型在关键指标(如BLEU-n和综合得分)上显著优于SOTA基线模型,最高提升达10%,证明了在低分隔符中文文本中提升语言特征捕捉能力的优势。

ABSTRACT

Story generation aims to generate a long narrative conditioned on a given input. In spite of the success of prior works with the application of pre-trained models, current neural models for Chinese stories still struggle to generate high-quality long text narratives. We hypothesise that this stems from ambiguity in syntactically parsing the Chinese language, which does not have explicit delimiters for word segmentation. Consequently, neural models suffer from the inefficient capturing of features in Chinese narratives. In this paper, we present a new generation framework that enhances the feature capturing mechanism by informing the generation model of dependencies between words and additionally augmenting the semantic representation learning through synonym denoising training. We conduct a range of experiments, and the results demonstrate that our framework outperforms the state-of-the-art Chinese generation models on all evaluation metrics, demonstrating the benefits of enhanced dependency and semantic representation learning.

研究动机与目标

  • 为解决由于句法歧义和缺乏分词分隔符而导致的中文长篇叙事生成流畅性与连贯性挑战。
  • 提升神经模型在中文中捕捉句法依存关系(如主语、宾语)的能力,因形态歧义使这些关系难以识别。
  • 通过训练模型识别同义表达,增强语义鲁棒性,减少语义等价但词汇不同的短语带来的混淆。
  • 开发一种数据增强框架,整合依存标注与语义去噪,以提升中文语言理解与生成质量。
  • 证明显式建模句法与语义特征可显著提升故事连贯性、流畅性与多样性。

提出的方法

  • 该框架使用HanLP进行依存解析,识别中文句子中的关键句法角色(如nsubj、dobj、root),实现对句子事件的结构化表征。
  • 依存标注模块将目标标签(nsubj、root、dobj、pobj)插入输入故事中,以引导生成器理解句法结构。
  • 基于SimBert的语义去噪模块生成输入短语的改写版本,使用同义表达(如“游历”、“周游”、“游览”用于表示“travelling”),迫使模型学习更鲁棒的语义表征。
  • 使用LongLM base(223M参数)作为条件生成器,基于输入提纲并结合依存与语义信号进行条件生成。
  • 在训练过程中联合使用依存标注与语义去噪,以协同提升句法意识与语义泛化能力。
  • 模型在LOT基准上进行微调,使用BLEU-n、Distinct-n、Coverage与Order指标进行评估,以衡量流畅性、多样性与与输入提纲的一致性。

实验结果

研究问题

  • RQ1显式建模句法依存关系是否能提升生成中文故事的连贯性与流畅性?
  • RQ2通过同义词替换实现的语义去噪是否能增强中文故事生成的鲁棒性与多样性?
  • RQ3句法与语义意识机制的联合使用在多大程度上优于仅依赖单一或两者皆无的模型?
  • RQ4在中文故事生成的自动评估指标上,所提框架与SOTA模型相比表现如何?
  • RQ5依存解析与语义去噪的整合是否能缓解中文中形态歧义带来的挑战?

主要发现

  • 所提模型在验证集与测试集上,于多个指标(包括BLEU-n与综合得分)上相较SOTA的LongLM大模型最高提升达10%。
  • 与LongLM base相比,综合得分提升10%,即使参数量更小,也显示出显著性能增益。
  • Coverage得分提升,表明生成故事与输入提纲短语的对齐性更好,尤其在输入无序的情况下。
  • Order得分提升,表明模型更有效地保持了输入短语在叙事中的位置顺序,反映出更强的语篇连贯性。
  • Distinct-n得分提升,表明语义去噪模块显著增强了生成文本的多样性。
  • 消融实验确认,依存标注与语义去噪均独立且协同贡献,完整模型在多数指标上优于所有消融变体。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。