Skip to main content
QUICK REVIEW

[论文解读] NusaCrowd: Open Source Initiative for Indonesian NLP Resources

Samuel Cahyawijaya, Holy Lovenia|arXiv (Cornell University)|Dec 19, 2022
Natural Language Processing Techniques被引用 9
一句话总结

NusaCrowd 是一项协作开源计划,汇集并标准化了 137 个印尼语 NLP 数据集和 118 个数据加载器,实现了印尼语及地方语言的自然语言理解(NusaNLU)与生成(NusaNLG)的首个零样本基准测试,以及首个多语言自动语音识别(ASR)基准测试(NusaASR)。该计划首次公开了 14 个此前私有的数据集,并在文本、语音和图像模态下支持跨 19 种语言的 100 多个数据集。

ABSTRACT

We present NusaCrowd, a collaborative initiative to collect and unify existing resources for Indonesian languages, including opening access to previously non-public resources. Through this initiative, we have brought together 137 datasets and 118 standardized data loaders. The quality of the datasets has been assessed manually and automatically, and their value is demonstrated through multiple experiments. NusaCrowd's data collection enables the creation of the first zero-shot benchmarks for natural language understanding and generation in Indonesian and the local languages of Indonesia. Furthermore, NusaCrowd brings the creation of the first multilingual automatic speech recognition benchmark in Indonesian and the local languages of Indonesia. Our work strives to advance natural language processing (NLP) research for languages that are under-represented despite being widely spoken.

研究动机与目标

  • 通过整合分散、未记录且非公开的印尼语 NLP 数据集,解决印尼语 NLP 资源严重匮乏与碎片化问题。
  • 克服因标注数据有限和语言多样性不足,导致印尼语及地方语言在 NLP 研究中代表性不足的问题。
  • 通过创建标准化、高质量的基准测试,实现对印尼语 NLP 的零样本和少样本迁移学习。
  • 通过精心整理的语音语料库,推进印尼语及本地语言的多语言自动语音识别(ASR)。
  • 通过发布此前私有的数据集并建立可持续的、由社区驱动的印尼语 NLP 资源基础设施,推动开放科学。

提出的方法

  • 系统性地从学术、机构和私人存储库等多种来源收集并整理了 137 个数据集。
  • 在 NusaCrowd 数据中心实现标准化数据加载器,确保与各类 NLP 框架和模型的互操作性。
  • 通过母语者和 NLP 专家进行人工与自动的质量评估,确保数据集的可靠性与一致性。
  • 基于 12 种印尼语及地方语言的 40 个 NLU 和 40 个 NLG 任务,构建 NusaNLU 与 NusaNLG 基准测试,支持零样本评估。
  • 利用约 800 小时的多语言语音数据,构建涵盖 10 种印尼语的 NusaASR 基准测试,支持单语和多语 ASR 模型训练。
  • 发布 NusaCatalogue 与 NusaCrowd 数据中心作为开源平台,确保长期可访问性与社区参与。

实验结果

研究问题

  • RQ1如何将分散且非公开的印尼语 NLP 资源统一为标准化、可访问且由社区维护的平台?
  • RQ2在资源匮乏的印尼语及地方语言中,零样本迁移学习在自然语言理解与生成方面可实现的程度如何?
  • RQ3现有印尼语 NLP 数据集在文本、语音和图像模态下的质量与多样性如何?
  • RQ4能否通过精心整理的开放获取语音语料库,构建适用于印尼语及地方语言的多语言 ASR 基准测试?
  • RQ5当前最先进的多语言模型在新引入的印尼语 NLP 任务零样本基准测试中的表现如何?

主要发现

  • NusaCrowd 成功整合了 137 个数据集和 118 个标准化数据加载器,成为迄今为止最大的印尼语 NLP 资源集中存储库。
  • 该计划首次公开了 14 个此前私有的数据集,显著扩展了资源匮乏语言的资源基础。
  • NusaNLU 基准测试涵盖 12 种语言的 40 个 NLU 任务,支持多语言模型在低资源语言上的零样本评估。
  • NusaNLG 基准测试包含 12 种语言的 40 个自然语言生成任务,支持对印尼语及地方语言生成模型的评估。
  • NusaASR 基准测试包含 10 种印尼语的约 800 小时语音数据,支持多语言 ASR 模型的开发。
  • 对所收集数据集的综合分析揭示了数据质量、规模和语言覆盖范围方面存在显著差异,凸显了标准化整理与社区参与的必要性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。