[论文解读] Shamela: A Large-Scale Historical Arabic Corpus
本文介绍了 Shamela,一个涵盖1,400年历史的10亿词阿拉伯语文本语料库,其数据源自 Al-Maktaba Al-Shamela 数字图书馆。作者对语料库进行了清洗、词形还原,并通过自动文本定年和并行段落检测技术进行增强,使大规模数字人文与自然语言处理研究成为可能,以探究阿拉伯语的演变。关键发现表明,阿拉伯语词汇的平均寿命为1,124年,远长于英语词汇。
Arabic is a widely-spoken language with a rich and long history spanning more than fourteen centuries. Yet existing Arabic corpora largely focus on the modern period or lack sufficient diachronic information. We develop a large-scale, historical corpus of Arabic of about 1 billion words from diverse periods of time. We clean this corpus, process it with a morphological analyzer, and enhance it by detecting parallel passages and automatically dating undated texts. We demonstrate its utility with selected case-studies in which we show its application to the digital humanities.
研究动机与目标
- 为解决缺乏覆盖阿拉伯语全部书面历史时期的大型、历史标注阿拉伯语文本语料库的问题。
- 支持对14个世纪以来阿拉伯语进行基于语料库的历史语言学分析。
- 支持阿拉伯文化与思想史的数字人文研究。
- 通过增强的元数据与标准化处理,提升历史阿拉伯语文本的自然语言处理应用。
- 开发可扩展的计算方法,用于低资源历史语言中的文本定年与并行段落检测。
提出的方法
- 从 Al-Maktaba Al-Shamela 网站提取约10亿词,该网站是阿拉伯文文本的大型公共档案库。
- 执行自动化文本清洗与半自动元数据增强,包括时间轴标注。
- 应用形态分析器对所有词汇进行词形还原,以支持语义与句法分析。
- 使用语言模型对1,200篇未标注日期的文本进行自动定年,准确度较高。
- 实现一种计算高效的算法,用于检测语料库中近似并行段落,同时过滤掉频繁重复的内容。
- 通过案例研究与词表分析,对结果进行定量与定性双重验证。
实验结果
研究问题
- RQ1在覆盖相似历史跨度的情况下,阿拉伯语词汇的寿命与英语词汇相比如何?
- RQ2自动语言模型在多大程度上能准确为来自不同历史时期的未标注日期阿拉伯语文本进行定年?
- RQ3在大规模历史阿拉伯语文本语料库中存在哪些类型的并行段落?它们如何反映文本的重复使用或影响?
- RQ4该语料库能否支持检测阿拉伯语词汇的语义演变,例如 'ḥawālay' 从表示物理接近到表示数值近似的演变?
- RQ5计算方法如何增强历史语料库,以支持低资源语言的数字人文与自然语言处理研究?
主要发现
- 阿拉伯语词形(lemma)的平均寿命为1,124年(标准差:338年,中位数:1,222年),约占语料库总时间跨度的83%。
- 相比之下,COHA中英语词汇的平均寿命仅为68年(标准差:58,中位数:60),约占语料库时间跨度的36%。
- 词汇 'ḥawālay' 最早在1201年即用于表示物理接近,其表示数值近似的用法在中世纪时期已确立,与现代创新的说法相矛盾。
- 并行段落检测算法在过滤掉1,860万词的频繁重复内容后,识别出超过500万对长度超过20个词的段落匹配。
- 自动文本定年模型取得了高质量结果,经定量与定性双重验证,显著提升了未标注文本的时间分辨率。
- 该语料库已公开发布于 GitHub 上的 RAWrabica 收藏集,支持可复现性与进一步研究。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。