Skip to main content
QUICK REVIEW

[论文解读] Bridging the Gap for Tokenizer-Free Language Models

Dokook Choe, Rami Al‐Rfou|arXiv (Cornell University)|Aug 27, 2019
Topic Modeling参考文献 25被引用 14
一句话总结

本论文表明,通过直接在原始字节上进行训练的深度变换器语言模型——无需任何分词处理——可以在 One Billion Word(lm1b)基准测试中实现最先进性能,与基于词的模型相当。该模型包含40层自注意力机制和8.36亿参数,通过深度上下文建模学习到稳健的词表示,证明了在使用足够容量的情况下,无需分词器的模型也能与分词模型竞争。

ABSTRACT

Purely character-based language models (LMs) have been lagging in quality on large scale datasets, and current state-of-the-art LMs rely on word tokenization. It has been assumed that injecting the prior knowledge of a tokenizer into the model is essential to achieving competitive results. In this paper, we show that contrary to this conventional wisdom, tokenizer-free LMs with sufficient capacity can achieve competitive performance on a large scale dataset. We train a vanilla transformer network with 40 self-attention layers on the One Billion Word (lm1b) benchmark and achieve a new state of the art for tokenizer-free LMs, pushing these models to be on par with their word-based counterparts.

研究动机与目标

  • 挑战‘词分词对高性能语言模型至关重要’这一假设。
  • 评估纯字符/字节级变换器是否能在大规模语言建模任务中实现具有竞争力的性能。
  • 分析无分词器模型中的中间表示是否能捕捉有意义的词级语义。
  • 探索在充分利用架构容量的前提下,端到端、无预处理语言建模的可行性。

提出的方法

  • 模型采用标准变换器解码器结构,利用因果注意力机制预测序列中的下一个字节,直接处理原始UTF-8字节。
  • 采用256维字节嵌入层,以及包含40层、隐藏层尺寸1024、前馈网络尺寸8192、注意力头数16的深层架构。
  • 训练使用随机截取的512字节序列,注意力和前馈层应用Dropout正则化,优化器采用Adam,并使用学习率衰减策略。
  • 通过输入单个词后加空格的方式提取词表示,将空格标记处的激活值作为词级表示的代理。
  • 通过计算提取表示之间的余弦相似度,并与人工标注的词对进行对比,评估词相似性任务。
  • 开发阶段采用滑动窗口预测策略以加速评估,最终测试中使用完整的自回归评分机制。

实验结果

研究问题

  • RQ1具备足够容量的无分词器语言模型是否能在大规模语言建模基准上实现具有竞争力的性能?
  • RQ2尽管缺乏显式的词边界监督,字节级模型中的深层变换器层是否仍能学习到有意义的词级表示?
  • RQ3在字节级变换器中,不同深度层的词表示质量如何变化?
  • RQ4架构深度与容量对纯字节级语言模型性能有何影响?
  • RQ5字节级模型中的中间激活是否可有效用于下游语义任务(如词相似性)?

主要发现

  • 在stride=256时,测试的每字节比特数为0.87413;在stride=1时为0.874055,表明滑动窗口评估策略对性能影响极小。
  • 该模型在One Billion Word基准上为无分词器语言模型设定了新的最先进水平,优于先前的字符级模型。
  • 在WS353sim数据集上,斯皮尔曼等级相关系数达到0.43;在RareWords数据集上达到0.46,表明中间表示虽未显式训练于该任务,仍能捕捉语义相似性。
  • 词相似性任务的性能在第1至10层之间持续提升,从第11至40层趋于平稳或略有下降,表明早期层更擅长学习通用语言特征。
  • 模型对罕见词的表示能力随深度增强,表明深层可能专门用于捕捉低频词或复杂词形变化模式。
  • 尽管未针对词表示进行训练,模型的中间激活与人工标注的词相似性表现出有意义的相关性,证明了语义学习的涌现特性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。