Skip to main content
QUICK REVIEW

[论文解读] ALBERTI, a Multilingual Domain Specific Language Model for Poetry Analysis

Javier de la Rosa, Álvaro Pérez Pozo|arXiv (Cornell University)|Jul 3, 2023
Topic Modeling被引用 4
一句话总结

本文提出了 Alberti,这是首个在涵盖12种语言的超过1200万行诗歌文本上,使用领域特定预训练(DSP)技术在多语言 BERT 上进行预训练的多语言领域特定语言模型。它在西班牙语诗节分类和韵律模式预测任务上达到了最先进性能,优于 mBERT 甚至在德语中也优于基于规则的系统,证明了 DSP 在多语言诗歌分析中的有效性。

ABSTRACT

The computational analysis of poetry is limited by the scarcity of tools to automatically analyze and scan poems. In a multilingual settings, the problem is exacerbated as scansion and rhyme systems only exist for individual languages, making comparative studies very challenging and time consuming. In this work, we present extsc{Alberti}, the first multilingual pre-trained large language model for poetry. Through domain-specific pre-training (DSP), we further trained multilingual BERT on a corpus of over 12 million verses from 12 languages. We evaluated its performance on two structural poetry tasks: Spanish stanza type classification, and metrical pattern prediction for Spanish, English and German. In both cases, extsc{Alberti} outperforms multilingual BERT and other transformers-based models of similar sizes, and even achieves state-of-the-art results for German when compared to rule-based systems, demonstrating the feasibility and effectiveness of DSP in the poetry domain.

研究动机与目标

  • 为解决诗歌分析中多语言计算工具的稀缺性,特别是韵律与结构分析方面的不足。
  • 克服单语模型和基于规则的系统在跨语言泛化与可扩展性方面的局限。
  • 探究在诗歌语料上进行领域特定预训练(DSP)是否能提升多种语言中诗歌特定 NLP 任务的性能。
  • 发布一个面向诗歌的多语言语言模型及其数据集,以支持数字人文与 NLP 领域的未来研究。

提出的方法

  • 在涵盖12种语言的超过1200万行诗歌文本的精选语料库上,对多语言 BERT(mBERT)进行微调,采用掩码语言建模(MLM)进行领域特定预训练。
  • 将诗歌分析任务(如诗节类型分类与韵律模式预测)重新表述为文本分类问题,以利用迁移学习的优势。
  • 在来自公开来源的多语言诗歌数据集上训练模型,涵盖西班牙语、英语、德语及其他语言的诗歌形式。
  • 通过在多语言诗歌基准(PULPO)上的困惑度评估内在性能,并在下游分类任务上评估外在性能。
  • 使用 ROC-AUC 和 F1 分数,将 Alberti 在诗节分类与韵律预测任务上与 mBERT 及其他基线模型进行比较。
  • 发布 Alberti 模型权重与训练语料,以支持可复现性及多语言诗歌 NLP 领域的进一步研究。

实验结果

研究问题

  • RQ1与通用多语言模型相比,在多语言诗歌语料上进行领域特定预训练是否能提升诗歌特定 NLP 任务的性能?
  • RQ2在诗歌上微调的多语言语言模型是否在诗节类型分类与韵律模式预测任务中优于 mBERT 及其他基于 Transformer 的模型?
  • RQ3单一多语言模型在涵盖复杂韵律规则语言(如德语与西班牙语)的多种诗歌形式上,其泛化能力在多大程度上得以实现?
  • RQ4在诗歌文本上训练的领域特定语言模型是否能在韵律模式预测任务中达到最先进性能,甚至超越基于规则的系统?
  • RQ5通过内在与外在评估指标衡量,该模型在捕捉多种语言诗歌的语言与结构细微特征方面有多高效?

主要发现

  • Alberti 在 PULPO 困惑度基准上优于 mBERT,平均困惑度为 83.31,低于 mBERT 的 128.64,表明其在诗歌文本上的语言建模能力更强。
  • 在西班牙语诗节类型分类任务中,Alberti 在 Tercetillo 类型上 AUC 平均得分为 0.9857,Rom. arte mayor 类型最高达 0.9998,显著优于 mBERT 的最佳 AUC 值 0.9857。
  • 在德语韵律模式预测中,Alberti 达到了最先进性能,其 Lira 形式的 AUC 达到 0.9981,超越了基于规则的系统。
  • Alberti 在 Cuarteto 形式上 F1 得分为 0.9767,在 Copla mixta 形式上达 0.9975,展现出在多样化诗歌结构上的强大泛化能力。
  • 该模型在内在(困惑度)与外在(分类)评估中,所有12种语言均表现出一致的性能提升,显示出强大的跨语言迁移能力。
  • Alberti 及其训练语料的发布,为未来多语言诗歌分析提供了基础性资源,支持在不同语言传统间开展大规模比较研究。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。