[论文解读] A Tweet Dataset Annotated for Named Entity Recognition and Stance Detection
本文介绍了一个公开可用的土耳其语推文数据集,该数据集同时标注了命名实体识别(NER)和立场检测,支持对自然语言处理中这两项任务相互作用的研究。该数据集包含1,000条推文,采用零基字符级NER标注(PERSON、LOCATION、ORGANIZATION),并附有立场标签(Favor、Against、Neither),是首个同时包含这两类标注的数据集,当命名实体被用作特征时,可支持提升立场检测性能。
Annotated datasets in different domains are critical for many supervised learning-based solutions to related problems and for the evaluation of the proposed solutions. Topics in natural language processing (NLP) similarly require annotated datasets to be used for such purposes. In this paper, we target at two NLP problems, named entity recognition and stance detection, and present the details of a tweet dataset in Turkish annotated for named entity and stance information. Within the course of the current study, both the named entity and stance annotations of the included tweets are made publicly available, although previously the dataset has been publicly shared with stance annotations only. We believe that this dataset will be useful for uncovering the possible relationships between named entity recognition and stance detection in tweets.
研究动机与目标
- 为解决土耳其语等低资源语言在社交媒体自然语言处理任务中多语言、多标注数据集稀缺的问题。
- 支持研究命名实体标注对提升立场检测性能的潜在贡献。
- 提供一个公开可访问的、高质量的土耳其语推文数据集,同时包含NER和立场标注。
- 支持监督式自然语言处理模型在土耳其语社交媒体文本分析中的开发与评估。
- 补充先前研究中虽使用命名实体作为特征进行立场检测,但未公开完整标注数据集的不足。
提出的方法
- 该数据集从1,000条土耳其语推文中构建,人工标注了命名实体和立场。
- 命名实体采用零基字符跨度方案标注,类型包括:PERSON、LOCATION、ORGANIZATION。
- 立场标注针对特定目标(如Galatasaray、Fenerbahçe),标注为Favor、Against或Neither。
- 标注以结构化、分号分隔的格式存储,包含推文ID、目标、立场类别以及命名实体三元组列表(起始位置、结束位置、类型)。
- 该数据集源自先前的立场检测研究,并扩展了NER标注,确保与前期工作的一致性。
- 最终数据集已公开共享,首次同时提供立场和NER标注。
实验结果
研究问题
- RQ1命名实体标注能否提升土耳其语推文中立场检测模型的性能?
- RQ2在社交媒体文本中,命名实体识别与立场检测之间存在何种关系?
- RQ3不同类型的命名实体(如ORGANIZATION、PERSON)对立场分类的贡献如何?
- RQ4共享的、具备双重标注的数据集在多大程度上能推进低资源语言(如土耳其语)的自然语言处理研究?
- RQ5如先前实验所建议,将命名实体作为特征用于立场检测是否具有可测量的益处?
主要发现
- 该数据集是首个公开可用的、针对土耳其语推文同时标注命名实体识别和立场检测的资源。
- 先前实验表明,命名实体特征可略微提升基于SVM的立场检测模型性能,提示两项任务之间可能存在潜在关联。
- 该数据集包含1,000条推文,附有手工标注的立场目标和立场类别,以及精确的字符级命名实体跨度。
- 在单一公开共享数据集中同时包含两类标注,可支持跨任务特征利用和模型迁移的新研究。
- 该数据集有望支持未来针对土耳其语自然语言处理的研究,特别是在此类资源稀缺的低资源环境下。
- 数据集采用分号分隔字段和零基索引的结构化格式,确保可复现性,并便于集成到自然语言处理流水线中。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。