Skip to main content
QUICK REVIEW

[论文解读] Automatic Creation of Text Corpora for Low-Resource Languages from the Internet: The Case of Swiss German

Lucy Linder, Michael Jungo|arXiv (Cornell University)|Nov 30, 2019
Natural Language Processing Techniques被引用 5
一句话总结

本文提出 SwissCrawl,这是迄今为止最大的公开可用书面瑞士德语语料库,通过定制化网络爬虫从多种在线来源(包括多语言页面和非正式内容)提取文本而构建。该语料库包含超过 480,000 个句子,在结合现有数据训练时,使语言建模的困惑度在莱比锡测试集上降低了 36%。

ABSTRACT

This paper presents SwissCrawl, the largest Swiss German text corpus to date. Composed of more than half a million sentences, it was generated using a customized web scraping tool that could be applied to other low-resource languages as well. The approach demonstrates how freely available web pages can be used to construct comprehensive text corpora, which are of fundamental importance for natural language processing. In an experimental evaluation, we show that using the new corpus leads to significant improvements for the task of language modeling. To capture new content, our approach will run continuously to keep increasing the corpus over time.

研究动机与目标

  • 解决低资源语言(如瑞士德语)自然语言处理资源匮乏的问题。
  • 开发一种可扩展的自动化方法,尽管缺乏官方顶级域名(TLD)且拼写不一致,仍能从互联网上收集书面瑞士德语。
  • 创建一个全面且最新的语料库,反映社交媒体和论坛等非正式语境中的真实语言使用情况。
  • 证明该语料库在提升自然语言处理任务(尤其是语言建模)中的实用性。
  • 通过迭代式、人机协同的网络爬取方式,实现语料库的持续扩展。

提出的方法

  • 定制化的网络爬虫使用多策略种子生成器,生成多样化的搜索查询,包括三元组、频率加权的词组合以及人工整理的输入。
  • 系统采用广度优先的爬取策略,从种子 URL 扩展,通过 HTML 解析和启发式方法提取网页中的相关文本内容。
  • 使用置信度阈值为 99% 的语言识别模型,仅保留极有可能为瑞士德语的句子,从而减少德语高地德语及其他语言带来的噪声。
  • 通过针对非正式标点(包括 ASCII 表情符号和方言特有的标点模式)敏感的启发式方法对文本进行句子切分。
  • 基于精确字符匹配去除重复句子,对 umlaut 变体和截断情况做特殊处理。
  • 通过定期重新运行处理管道,持续扩展语料库,以捕捉不断演变的在线内容。

实验结果

研究问题

  • RQ1尽管缺乏专用顶级域名且拼写不一致,可扩展的自动化网络爬取管道是否能有效从互联网收集书面瑞士德语?
  • RQ2与现有更受控的语料库相比,从非正式在线来源收集的语料库在语言真实性和自然语言处理任务中的实用性方面,其质量和多样性如何?
  • RQ3与传统的小型或更正式的语料库相比,大规模非正式语料库的引入在多大程度上提升了瑞士德语的语言建模性能?
  • RQ4随着语言知识的演变,人机协同的迭代式系统设计是否能有效改进和优化语料库收集流程?
  • RQ5在多语言或用户生成内容的语境下,从非结构化网络内容中提取和切分瑞士德语文本的主要挑战是什么?

主要发现

  • SwissCrawl 语料库包含 483,526 个唯一句子,是迄今为止已知最大的书面瑞士德语语料库。
  • 该语料库显著提升了语言建模性能,在同时使用 SwissCrawl 和莱比锡数据训练时,使莱比锡测试集上的困惑度降低了 36%。
  • 仅在 SwissCrawl 上训练的模型在其自身测试集上的困惑度为 45.9,优于仅使用莱比锡数据训练的模型在相同数据上的表现。
  • 仅使用莱比锡数据训练的模型泛化能力差,当在 SwissCrawl 测试集上评估时,困惑度几乎翻倍(从 47.6 上升至 92.6)。
  • 该语料库捕捉到了真实的非正式用法,包括俚语、省略结构和非标准标点,真实反映了现实中的瑞士德语书写。
  • 该系统成功识别并过滤了大部分非瑞士德语内容,误报主要限于拼写错误的高地德语或区域性方言。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。