Skip to main content
QUICK REVIEW

[论文解读] The ParlaSent Multilingual Training Dataset for Sentiment Identification in Parliamentary Proceedings

Michal Mocht̆ak, Peter Rupnik|arXiv (Cornell University)|Sep 18, 2023
Natural Language Processing TechniquesComputer Science被引用 3
一句话总结

本文介绍了ParlaSent,一个涵盖五种欧洲语言(捷克语、英语、塞尔维亚-克罗地亚语、斯洛伐克语、斯洛文尼亚语)的多语言、人工标注数据集,包含13,000条议会发言,按六级情感进行标注。研究证明,将多语言XLM-RoBERTa模型在该数据集上进行微调——尤其是结合17.2亿条领域特定的议会文本进行额外预训练——可显著提升情感分类性能,即使在未见过的语言和议会中也表现出良好的泛化能力。

ABSTRACT

The paper presents a new training dataset of sentences in 7 languages, manually annotated for sentiment, which are used in a series of experiments focused on training a robust sentiment identifier for parliamentary proceedings. The paper additionally introduces the first domain-specific multilingual transformer language model for political science applications, which was additionally pre-trained on 1.72 billion words from parliamentary proceedings of 27 European parliaments. We present experiments demonstrating how the additional pre-training on parliamentary data can significantly improve the model downstream performance, in our case, sentiment identification in parliamentary proceedings. We further show that our multilingual model performs very well on languages not seen during fine-tuning, and that additional fine-tuning data from other languages significantly improves the target parliament's results. The paper makes an important contribution to multiple disciplines inside the social sciences, and bridges them with computer science and computational linguistics. Lastly, the resulting fine-tuned language model sets up a more robust approach to sentiment analysis of political texts across languages, which allows scholars to study political sentiment from a comparative perspective using standardized tools and techniques.

研究动机与目标

  • 解决政治科学领域中低资源欧洲语言缺乏高质量、领域特定情感数据集的问题。
  • 通过在比较性议会研究中实现稳健、标准化的情感分析,弥合计算语言学与社会科学之间的鸿沟。
  • 为社会科学家提供一种实用且资源意识明确的框架,用于在政治话语上构建和训练情感分类器。
  • 展示多语言和领域自适应预训练在提升低资源政治文本情感分类性能方面的优势。

提出的方法

  • 从27个欧洲议会中收集并人工标注每个议会组2,600条语句(共5个议会组),采用六级情感标注方案。
  • 在来自多种语言的议会程序文本中提取的17.2亿个领域特定词汇上,对多语言XLM-RoBERTa模型进行预训练。
  • 使用序列分类的交叉熵损失函数,在ParlaSent数据集上对预训练模型进行微调。
  • 训练单语和多语言模型,比较仅使用目标语言数据训练与使用多语言数据联合训练的性能差异。
  • 通过英国和巴尔干国家议会(波黑、克罗地亚、塞尔维亚)的保留测试集,评估模型在未见语言和议会中的性能。
  • 使用评分者间一致性(Cohen’s Kappa ≈ 0.65)验证不同语言和议会间标注的一致性。

实验结果

研究问题

  • RQ1在原始议会文本上进行额外预训练是否能提升基于Transformer的情感分类器性能?
  • RQ2多语言模型在未包含在训练数据中的未见语言和议会中泛化能力如何?
  • RQ3在来自多个议会的多语言数据上训练情感分类器,是否比仅在单一议会的单语数据上训练更有效?
  • RQ4在不同语言和议会间,评分者间一致性在多大程度上保持较高水平,表明标注指南具有足够的详细性和一致性?

主要发现

  • 在17.2亿条来自议会程序的领域特定文本上进行额外预训练,显著提升了下游情感分类性能。
  • 多语言XLM-R-Parla模型在未见语言和议会中表现强劲,性能下降极小,表明其具备强大的跨语言泛化能力。
  • 在除捷克语外的所有议会中,使用其他语言四倍以上数据进行多语言训练的模型,其性能均优于仅使用目标语言数据训练的单语模型;捷克语中性能相当。
  • 在UK测试集上,微调后的XLM-R-ParlaSent模型取得0.665的宏F1分数,在BCS测试集上取得0.708,表明其具备强大的零样本泛化能力。
  • 评分者间一致性(Cohen’s Kappa ≈ 0.65)表明,标注指南在不同语言和议会间具备足够的详细性和一致性。
  • 当在多语言数据上进行训练时,模型表现最佳,表明跨议会和跨语言的情感表达模式对分类有益。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。