Skip to main content
QUICK REVIEW

[论文解读] Temporal Embeddings and Transformer Models for Narrative Text Understanding

K Vani, Simone Mellace|arXiv (Cornell University)|Mar 19, 2020
Topic Modeling参考文献 28被引用 7
一句话总结

本文提出一种双深度学习方法用于叙事文本理解:利用 BERT 对静态角色关系(如亲属关系)进行监督分类,同时利用时间嵌入(temporal word embeddings)建模角色关系随时间的动态演变。实证结果表明,在《哈利·波特》数据集上 F 得分高达 78%,并能有效可视化关系轨迹,证明该方法在文学 NLP 和通用 NLU 基准测试方面具有潜力。

ABSTRACT

We present two deep learning approaches to narrative text understanding for character relationship modelling. The temporal evolution of these relations is described by dynamic word embeddings, that are designed to learn semantic changes over time. An empirical analysis of the corresponding character trajectories shows that such approaches are effective in depicting dynamic evolution. A supervised learning approach based on the state-of-the-art transformer model BERT is used instead to detect static relations between characters. The empirical validation shows that such events (e.g., two characters belonging to the same family) might be spotted with good accuracy, even when using automatically annotated data. This provides a deeper understanding of narrative plots based on the identification of key facts. Standard clustering techniques are finally used for character de-aliasing, a necessary pre-processing step for both approaches. Overall, deep learning models appear to be suitable for narrative text understanding, while also providing a challenging and unexploited benchmark for general natural language understanding.

研究动机与目标

  • 为解决尽管文学文本具有丰富的词汇和复杂实体关系,但在深度学习领域仍研究不足的叙事文本理解挑战。
  • 开发一种基于 BERT 的监督方法,用于分类静态角色关系(如亲属关系),利用自动生成的训练数据以减少对昂贵人工标注的依赖。
  • 通过时间嵌入建模角色关系随时间的动态演变,实现基于轨迹的关系变化分析。
  • 通过应用基于密度的聚类(DBSCAN)进行命名实体识别后的角色去重,改进叙事分析的预处理。
  • 将文学文本确立为先进 NLP 模型的具有挑战性的基准,尤其因其复杂的关系结构。

提出的方法

  • 基于 BERT 的分类器在句子级别数据上进行微调,以预测角色关系,采用句子集合策略将预测结果聚合至角色对级别。
  • 通过启发式方法对文本中同一家庭组的角色提及进行聚类,自动生成亲属关系的训练数据。
  • 在书籍中固定长度的文本片段(1000 个字符)上训练时间嵌入,通过共享初始化确保时间维度上的向量可比性。
  • 通过在每个时间片段提取关键角色的嵌入向量构建角色轨迹,利用余弦距离分析语义接近度。
  • 使用 t-SNE 将高维轨迹投影至二维以进行可视化,揭示如分离或结盟等关系动态。
  • 对命名实体应用 DBSCAN 聚类以解决别名问题(如 Ron 和 Ronald),确保叙事中角色追踪的一致性。

实验结果

研究问题

  • RQ1在缺乏人工标注的情况下,BERT 是否能有效利用自动生成的训练数据对文学文本中的静态角色关系进行分类?
  • RQ2时间嵌入在多大程度上能够捕捉叙事过程中角色关系的动态演变?
  • RQ3可视化角色轨迹在多大程度上能反映已知的叙事关系(如友谊或敌意)?
  • RQ4无监督的时间嵌入能否揭示有意义的关系转变,如角色分离或结盟?
  • RQ5这些方法在具有不同叙事结构和词汇复杂度的文学文本之间具有多大泛化能力?

主要发现

  • 基于 BERT 的分类器在《哈利·波特》数据集上,通过聚合每对角色所有句子的预测结果,取得了 78%(±7%)的 F 得分,表明在复杂文学领域具有优异性能。
  • 正类 F 得分为 73%(±4%),负类 F 得分为 81%(±8%),尽管存在类别不平衡,仍表现出良好平衡性。
  • 在使用《哈利·波特》训练数据测试 LW 基准时,F 得分下降至 64%,表明可能存在过拟合,并凸显了叙事结构在不同领域间的差异。
  • 时间嵌入成功捕捉了关系动态:哈利与罗恩、赫敏的余弦距离随时间减小,而与伏地魔的距离始终保持高位且稳定,符合叙事角色设定。
  • 对《小妇人》的时间嵌入 t-SNE 可视化显示,在小说核心阶段,乔与艾米(离开家)与其他两位姐妹明显分离,证实模型能够检测到关系转变。
  • DBSCAN 去重与时间嵌入相结合,实现了角色轨迹的一致追踪,构建了稳健的叙事理解处理流程。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。