[论文解读] Low resource language dataset creation, curation and classification: Setswana and Sepedi -- Extended Abstract
本文提出了一套框架,用于使用茨瓦纳语和塞佩迪语新闻标题创建、整理和分类低资源语言数据集,采用数据增强和预训练向量化器以提升分类性能。在小规模数据集上,逻辑回归和XGBoost模型取得了显著成果,证明了该方法在低资源自然语言处理任务中的可行性。
The recent advances in Natural Language Processing have only been a boon for well represented languages, negating research in lesser known global languages. This is in part due to the availability of curated data and research resources. One of the current challenges concerning low-resourced languages are clear guidelines on the collection, curation and preparation of datasets for different use-cases. In this work, we take on the task of creating two datasets that are focused on news headlines (i.e short text) for Setswana and Sepedi and the creation of a news topic classification task from these datasets. In this study, we document our work, propose baselines for classification, and investigate an approach on data augmentation better suited to low-resourced languages in order to improve the performance of the classifiers.
研究动机与目标
- 解决低资源语言,特别是南部非洲地区,缺乏整理过的语言资源的问题。
- 为茨瓦纳语和塞佩迪语这两种代表性不足的南非语言创建标注的新闻标题数据集。
- 开发一个分类框架,将简短的新闻标题归类到预定义的主题类别中,如政治、体育和犯罪。
- 研究适用于低资源语言的数据增强技术,以提升分类器的泛化能力。
- 为未来在茨瓦纳语和塞佩迪语自然语言处理任务中的研究建立基线。
提出的方法
- 从SABC广播电台和社交媒体收集了219条茨瓦纳语和491条塞佩迪语新闻标题。
- 将标题划分为10个预定义主题:法律、综合新闻、体育、其他、政治、交通新闻、社区活动、犯罪、商业和外交事务。
- 利用单语语料库构建多种向量化器:词袋、TF-IDF、Word2Vec和FastText,以改善表示效果。
- 使用5折交叉验证训练并评估多种分类器:逻辑回归、支持向量机分类、XGBoost和多层感知机。
- 应用基于word2vec的数据增强技术,以提升低资源文本的模型泛化能力。
- 使用来自维基百科、圣经和JW300的预训练词嵌入,以改善低词汇量数据集的向量表示。
实验结果
研究问题
- RQ1能否为茨瓦纳语和塞佩迪语等低资源语言建立系统化的数据集创建与整理框架?
- RQ2在低资源环境下,不同向量化技术(如TF-IDF、FastText)在表示简短新闻标题方面的有效性如何?
- RQ3基于word2vec的数据增强在小规模、低资源数据集上的分类性能提升程度如何?
- RQ4使用传统机器学习模型在茨瓦纳语和塞佩迪语新闻标题分类任务中可达到的基线性能如何?
- RQ5在这些低资源数据集上,不同分类器(如XGBoost与MLP)在准确率和鲁棒性方面有何比较?
主要发现
- 本研究成功创建了两个标注数据集,分别包含219条茨瓦纳语和491条塞佩迪语新闻标题,涵盖多样化主题。
- 逻辑回归和XGBoost在两个数据集上均表现出色,可作为未来研究的强基线。
- 使用word2vec的数据增强提升了分类器的泛化能力,尤其在低词汇量设置下效果显著。
- 基于单语语料库(如维基百科、圣经)构建的预训练向量化器,增强了短文本的表征学习能力。
- 该框架证明了可将类似方法推广至其他低资源南非语言。
- 研究结果凸显了精心整理的数据和定制化向量化在推动资源匮乏语言自然语言处理发展中的重要性。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。