Skip to main content
QUICK REVIEW

[论文解读] BPEmb: Tokenization-free Pre-trained Subword Embeddings in 275 Languages

Benjamin Heinzerling, Michael Strube|arXiv (Cornell University)|Oct 5, 2017
Topic Modeling参考文献 14被引用 128
一句话总结

BPEmb 提供对275种语言的预训练子词嵌入,使用字节对编码实现无-token化表示,在性能上与 FastText 及其他子词方法竞争力,同时资源消耗大幅更少。

ABSTRACT

We present BPEmb, a collection of pre-trained subword unit embeddings in 275 languages, based on Byte-Pair Encoding (BPE). In an evaluation using fine-grained entity typing as testbed, BPEmb performs competitively, and for some languages bet- ter than alternative subword approaches, while requiring vastly fewer resources and no tokenization. BPEmb is available at https://github.com/bheinzerling/bpemb

研究动机与目标

  • 发布跨 275 种语言的大规模预训练 BPE 基于子词嵌入集合。
  • 在细粒度实体类型任务上评估 BPEmb,并与 FastText 和字符嵌入进行比较。
  • 展示无 tokenization 的表示,并评估相对于其他方法的资源效率。
  • 分析 BPE 合并操作数量与嵌入维度对性能的影响。

提出的方法

  • 对所有维基百科应用字节对编码(BPE),在多种合并计数下获得 BPE 符号清单。
  • 在维基百科派生文本上使用 GloVe 对 BPE 符号预训练子词嵌入。
  • 提供多种 BPE 合并操作计数(1k–200k)和嵌入维度(25–300)的嵌入。
  • 在细粒度实体类型任务上使用来自 Wikidata 的提及并映射到 Freebase 类型来评估子词表示。
  • 在架构(RNN、CNN 和平均)下,将 BPEmb 与 FastText(支持分词和子词)以及基于字符的嵌入进行比较。
  • 报告在广泛的超参数搜索上的性能分布,并报告语言和架构特定结果。

实验结果

研究问题

  • RQ1在多语言上的细粒度实体类型任务中,BPEmb 是否能达到或超越 FastText 和字符嵌入的性能?
  • RQ2无 tokenization 的 BPEmb 表示在准确性上是否能达到分词方法的水平,同时提供显著的资源节省?
  • RQ3BPE 合并操作数量和嵌入维度如何影响各语言与架构的性能?
  • RQ4哪种架构(RNN、CNN 或 平均)最有效地利用 BPEmb 子词表示进行实体类型任务?

主要发现

  • BPEmb 在英语数据集上在所有架构中都优于其他子词单位(BPEmb 均值 0.624,标准差 0.029;最大 0.65),并且在显著降低内存占用的同时达到或超过 FastText 的性能。
  • BPEmb 在较低嵌入维度下也能取得竞争性结果(例如,100k BPE 符号,25 维时约 11 MB;而 FastText 在 300 维、300 万嵌入时约 6 GB)。
  • 在多语言实验中,当不使用显式分词时,资源丰富语言可达到与 FastText 相近的结果;对中低资源语言,BPEmb 在藏语和老挝语上获得提升,但因 unicode 处理差异导致高棉语结果下降。
  • 表格状语言结果显示 BPEmb 在多种语言上与 FastText 相当或略有提升(如英语 65.4 vs 62.9;中文 72.0 vs 71.0;日语 61.4 vs 62.3)。
  • 对嵌入取平均的架构是最弱的;RNN 的表现略优于 CNN,但训练时间更长;FastText 在超参数上的方差较低,而 BPEmb 和字符模型则表现出更高的方差。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。