[论文解读] AsNER -- Annotated Dataset and Baseline for Assamese Named Entity recognition
本文介绍了 AsNER,一个为阿萨姆语设计的低资源命名实体识别(NER)数据集,包含来自印度总理演讲和阿萨姆语戏剧的约 99,000 个词符,标注了人物、地点和地址三类实体。该研究提出了一种基于 MuRIL 嵌入的基线 Bi-LSTM-CRF 模型,F1 分数达到 80.69%,并公开发布了该数据集和表现最佳的模型,以推动阿萨姆语低资源自然语言处理研究。
We present the AsNER, a named entity annotation dataset for low resource Assamese language with a baseline Assamese NER model. The dataset contains about 99k tokens comprised of text from the speech of the Prime Minister of India and Assamese play. It also contains person names, location names and addresses. The proposed NER dataset is likely to be a significant resource for deep neural based Assamese language processing. We benchmark the dataset by training NER models and evaluating using state-of-the-art architectures for supervised named entity recognition (NER) such as Fasttext, BERT, XLM-R, FLAIR, MuRIL etc. We implement several baseline approaches with state-of-the-art sequence tagging Bi-LSTM-CRF architecture. The highest F1-score among all baselines achieves an accuracy of 80.69% when using MuRIL as a word embedding method. The annotated dataset and the top performing model are made publicly available.
研究动机与目标
- 为解决低资源印度语言(尤其是阿萨姆语)缺乏标注 NER 资源的问题。
- 从口语和文学来源构建高质量、多样化的阿萨姆语文本数据集,用于自然语言处理任务。
- 利用最先进的序列标注架构,为阿萨姆语 NER 建立一个强有力的基线模型。
- 通过发布数据集和训练好的模型,为未来基于深度学习的阿萨姆语自然语言处理研究提供支持。
- 在相同数据集上对多种预训练语言模型(如 BERT、XLM-R、MuRIL)进行基准测试,以实现公平比较。
提出的方法
- 数据集源自印度总理演讲的转录文本和阿萨姆语戏剧的对白,确保语言多样性。
- 命名实体由专家手动标注为三类:人物、地点和地址。
- 基线模型采用 Bi-LSTM-CRF 序列标注架构进行 NER 任务。
- 评估了多种预训练上下文嵌入方法作为输入表示:FastText、BERT、XLM-R、FLAIR 和 MuRIL。
- 使用标准 NER 指标(精确率、召回率和 F1 分数)进行模型训练与评估。
- 表现最佳的模型采用 MuRIL 嵌入,并在 AsNER 数据集上进行了微调。
实验结果
研究问题
- RQ1最先进的 NER 模型在新创建的、低资源的阿萨姆语 NER 数据集上的表现如何?
- RQ2不同预训练语言模型在阿萨姆语 NER 任务中的性能表现有何差异?
- RQ3在训练数据有限的情况下,微调后的 Bi-LSTM-CRF 模型能否在低资源 NER 任务中取得优异表现?
- RQ4阿萨姆语 NER 任务中,最优的模型架构与预训练嵌入组合是什么?
- RQ5数据集的质量与多样性如何影响下游 NER 任务的性能?
主要发现
- AsNER 数据集包含约 99,000 个词符,涵盖来自多样化来源的人物、地点和地址实体。
- 在 Bi-LSTM-CRF 架构中,使用 MuRIL 模型作为词嵌入方法,实现了最高的 F1 分数 80.69%。
- 在所评估的模型中,MuRIL 在 AsNER 数据集上的表现优于 BERT、XLM-R、FLAIR 和 FastText。
- 数据集和表现最佳的模型已公开发布,以支持未来阿萨姆语自然语言处理研究。
- 本研究证明,即使在低资源环境下,微调上下文嵌入(如 MuRIL)也能显著提升 NER 性能。
- 结果验证了 AsNER 数据集作为未来阿萨姆语自然语言处理研究基准的实用性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。