Skip to main content
QUICK REVIEW

[论文解读] Word Embeddings from Large-Scale Greek Web Content

Stamatis Outsios, Konstantinos Skianis|arXiv (Cornell University)|Oct 8, 2018
Natural Language Processing Techniques参考文献 3被引用 8
一句话总结

本论文展示了首个基于50GB语料库(包含2000万个希腊网页)训练的大型希腊语词嵌入,采用FastText并引入子词信息。主要贡献在于提供了一个公开可用、高质量的资源,并配备一个实时交互式网络工具,用于探索词向量的语义关系、相似性、类比关系以及t-SNE可视化。

ABSTRACT

Word embeddings are undoubtedly very useful components in many NLP tasks. In this paper, we present word embeddings and other linguistic resources trained on the largest to date digital Greek language corpus. We also present a live web tool for testing the Greek word embeddings, by offering "analogy", "similarity score" and "most similar words" functions. Through our explorer, one could interact with the Greek word vectors.

研究动机与目标

  • 通过爬取2000万个希腊语网页,创建目前最大规模的公开可用希腊语NLP语料库。
  • 基于大规模清洗后的语料库,利用FastText的子词建模技术,开发高质量的希腊语词嵌入。
  • 提供一个基于网络的实时交互式工具,用于探索希腊语词向量的语义关系,包括相似性、类比关系和聚类分析。
  • 提供语言学资源,如n-gram、停用词列表和词汇表,以支持下游NLP任务。
  • 通过t-SNE和k-means聚类在网页界面中实现语义关系的可视化。

提出的方法

  • 使用Heritrix在45天内爬取2000万个希腊语URL,以WARC格式存储数据以确保长期保存。
  • 使用多个库(Boilerpipe、BeautifulSoup、Justext)对文本进行预处理,以去除页眉页脚内容和非希腊语文本。
  • 按域名进行去重处理,使语料库规模减少75%,最终获得约50GB的干净文本,包含30亿个词符和1.18亿个唯一句子。
  • 训练多个基于FastText和gensim的skip-gram模型,向量维度为300维,优化参数为minCount=11和负采样。
  • 基于Flask构建网页界面,使用Jinja和Bootstrap技术,实现基于t-SNE降维和k-means聚类的词向量探索功能。
  • 支持交互式功能:相似性评分、最相似词查找、类比关系求解以及词组合对比。

实验结果

研究问题

  • RQ1与其它方法相比,基于大型希腊语网页语料库训练的FastText词嵌入在性能上表现如何?
  • RQ2去重和页眉页脚内容去除处理管道在提升NLP任务语料质量方面的有效性如何?
  • RQ3实时网络工具是否能有效支持对希腊语词向量中语义关系的探索与理解?
  • RQ4子词信息与skip-gram训练方式对希腊语语义相似性计算和拼写纠错任务的可靠性有何影响?
  • RQ5t-SNE可视化在多大程度上能揭示希腊语词嵌入中的有意义聚类和语义关系?

主要发现

  • 去重处理后,最终语料库包含约30亿个词符和1.18亿个唯一句子,原始数据规模减少了75%。
  • 采用子词信息的FastText skip-gram模型(minCount=11,负采样)在相似性与拼写纠错评估中表现最佳。
  • 网络交互式探索工具支持词向量的实时交互,可实现类比、相似性分析及语义聚类的t-SNE可视化。
  • 系统成功生成并公开发布了希腊语的单字词(约700万个)、双字词(约9000万个)和三字词(约3亿个)。
  • 语料库源自35万个希腊语域名和11.2万个WARC文件,共包含10TB的HTML内容。
  • 在8核32GB内存的系统上,训练过程耗时2天,证明了大规模希腊语NLP训练的可行性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。