[论文解读] hmBERT: Historical Multilingual Language Models for Named Entity Recognition
该论文提出 hmBERT,一种基于多语言 BERT 的语言模型,其在德语、英语、法语、瑞典语和芬兰语的历史 OCR 处理文本上进行预训练,以提升低资源历史领域中的命名实体识别(NER)性能。通过在过滤后的高置信度 OCR 语料上进行自监督预训练,结合领域特定的分词方式与多阶段微调,hmBERT 在 HIPE-2022 NERC-Coarse 挑战赛中达到最先进性能,在三种语言中的两种表现优于其他系统。
Compared to standard Named Entity Recognition (NER), identifying persons, locations, and organizations in historical texts constitutes a big challenge. To obtain machine-readable corpora, the historical text is usually scanned and Optical Character Recognition (OCR) needs to be performed. As a result, the historical corpora contain errors. Also, entities like location or organization can change over time, which poses another challenge. Overall, historical texts come with several peculiarities that differ greatly from modern texts and large labeled corpora for training a neural tagger are hardly available for this domain. In this work, we tackle NER for historical German, English, French, Swedish, and Finnish by training large historical language models. We circumvent the need for large amounts of labeled data by using unlabeled data for pretraining a language model. We propose hmBERT, a historical multilingual BERT-based language model, and release the model in several versions of different sizes. Furthermore, we evaluate the capability of hmBERT by solving downstream NER as part of this year's HIPE-2022 shared task and provide detailed analysis and insights. For the Multilingual Classical Commentary coarse-grained NER challenge, our tagger HISTeria outperforms the other teams' models for two out of three languages.
研究动机与目标
- 解决由于 OCR 错误、领域差异和标注数据有限导致的历史文本中低资源命名实体识别(NER)的挑战。
- 开发一种针对德语、英语、法语、瑞典语和芬兰语历史文本的多语言语言模型,利用自监督预训练。
- 通过过滤低置信度 OCR 输出并构建领域特定的子词词汇表,减轻 OCR 噪声和词汇不匹配问题。
- 在下游 NER 任务上评估模型的有效性,特别是在 HIPE-2022 共享任务的背景下。
- 公开提供模型与代码,以支持历史 NLP 和多语言 NER 领域的未来研究。
提出的方法
- 在来自多样化来源的大规模未标注历史文本上预训练一个多语言 BERT 模型(hmBERT),包括 OCR 处理的报纸和手稿。
- 应用过滤步骤,仅保留 OCR 置信度得分较高的文本,以减少字符识别错误带来的噪声。
- 从预训练数据的代表性子语料中构建领域特定的子词词汇表(32k 和 64k 词汇量大小),以提升对历史术语的覆盖能力。
- 采用两阶段微调方法对 hmBERT 模型进行微调:首先在多语言 NER 数据集上微调,然后按语言单独微调以优化性能。
- 通过手动将训练数据中的长 s(ſ)字符替换为 's',解决分词问题,防止出现 UNK 标记。
- 在 HIPE-2022 多语言古典评论 NER 挑战赛上评估性能,并比较单模型与单模型微调策略的效果。
实验结果
研究问题
- RQ1在过滤后的高置信度历史 OCR 语料上预训练的多语言 BERT 模型,是否能提升低资源历史语言环境下的 NER 性能?
- RQ2与通用领域词汇表相比,使用领域特定词汇表在历史文本处理中的 NER 性能有何影响?
- RQ3多阶段微调(先在多语言设置上微调,再按语言单独微调)是否优于端到端的单模型微调?
- RQ4架构选择(如 BERT 与 ELECTRA)对存在 OCR 噪声的历史文本下游 NER 性能有何影响?
- RQ5历史文本在时间分布上的不平衡性(如 18–19 世纪)在多大程度上影响模型泛化能力?如何缓解这一问题?
主要发现
- hmBERT 在 NewsEye NER 数据集上,对四种语言中的三种(法语、芬兰语和瑞典语)达到了最先进性能。
- 在 HIPE-2022 多语言古典评论 NER 挑战赛中,HISTeria 系统在三种语言中的两种表现优于其他团队的模型。
- 单模型微调策略(按语言单独微调每个模型)性能更高,但计算成本显著增加。
- 单模型方法效率更高,且性能相近,因此在计算资源受限时是可行的替代方案。
- 使用领域特定词汇表和 OCR 置信度过滤显著提升了模型的鲁棒性与实体识别准确率。
- 在相同语料上训练的 ELECTRA 基础模型在下游 NER 任务上比 BERT 基础模型低 1–3 个百分点,因此决定不发布该模型。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。