[论文解读] Language Modelling with Pixels
本文提出 pixel,一种基于视觉的神经语言模型,通过将文本渲染为图像并使用视觉变换器(Vision Transformer)进行编码,绕过了词汇瓶颈,实现了无需子词分词即可在多种书写系统间进行跨语言迁移。该模型在非拉丁字母脚本上的表现优于 BERT,且对拼写噪声和语言混用具有更强鲁棒性,但在拉丁字母脚本上略逊于 BERT,且在长句法依赖任务上表现稍弱。
Language models are defined over a finite set of inputs, which creates a vocabulary bottleneck when we attempt to scale the number of supported languages. Tackling this bottleneck results in a trade-off between what can be represented in the embedding matrix and computational issues in the output layer. This paper introduces PIXEL, the Pixel-based Encoder of Language, which suffers from neither of these issues. PIXEL is a pretrained language model that renders text as images, making it possible to transfer representations across languages based on orthographic similarity or the co-activation of pixels. PIXEL is trained to reconstruct the pixels of masked patches instead of predicting a distribution over tokens. We pretrain the 86M parameter PIXEL model on the same English data as BERT and evaluate on syntactic and semantic tasks in typologically diverse languages, including various non-Latin scripts. We find that PIXEL substantially outperforms BERT on syntactic and semantic processing tasks on scripts that are not found in the pretraining data, but PIXEL is slightly weaker than BERT when working with Latin scripts. Furthermore, we find that PIXEL is more robust than BERT to orthographic attacks and linguistic code-switching, further confirming the benefits of modelling language with pixels.
研究动机与目标
- 解决预训练语言模型中的词汇瓶颈问题,该问题限制了跨语言泛化能力,并在嵌入层与输出层设计之间造成权衡。
- 在不依赖有限的子词或字符词汇表的前提下,支持数千种书面语言,包括非拉丁字母脚本。
- 通过建模语言的视觉表征,提升对拼写变异、噪声和语言混用的鲁棒性。
- 探究基于 pixel 的编码方式是否能在类型学多样的语言之间实现强大的零样本和少样本迁移性能。
提出的方法
- 使用字体渲染器将文本渲染为固定大小的图像块,将输入序列转换为视觉标记。
- 视觉变换器(ViT)编码器处理图像块,且不使用可学习的标记嵌入层,从而消除词汇限制。
- 模型采用掩码自编码:在预训练期间,随机掩码的图像块由轻量级解码器重建。
- 预训练使用与 BERT 相同的仅英文数据,即 C4 数据集,以实现直接比较。
- 微调阶段在 ViT 编码器之上添加分类头,用于下游自然语言处理任务。
- 模型在涵盖 14 种书写系统(包括泰文、越南文和阿拉伯文等非拉丁字母)的 32 种语言的句法和语义任务上进行评估。
实验结果
研究问题
- RQ1在仅使用英文文本进行训练的视觉语言模型,能否在非拉丁字母脚本语言上实现有效泛化?
- RQ2pixel 在类型学多样的语言上的句法和语义任务中,与 BERT 和 mBERT 相比表现如何?
- RQ3与基于子词的模型相比,pixel 在多大程度上提升了对拼写噪声和语言混用的鲁棒性?
- RQ4通过 pixel 的视觉表征学习,能否缓解多语言 NLP 中的词汇瓶颈问题?
- RQ5句法依赖长度如何影响 pixel 与 BERT 在句法分析任务中的性能差异?
主要发现
- 在非拉丁字母脚本上,pixel 显著优于 BERT,例如在泰语(LAS:50.2 vs. 35.7)和中文(LAS:54.1 vs. 46.2)上表现更优。
- 在拉丁字母脚本上,pixel 表现略逊于 BERT,英语上的 LAS 差距为 6.5 分(77.2 vs. 83.7),表明在熟悉脚本上存在性能权衡。
- pixel 对拼写攻击和语言混用表现出更强鲁棒性,证实了视觉表征学习在处理噪声输入方面的优势。
- 该模型在未见过的字体上展现出强大的零样本迁移能力,无需数据增强即可实现高性能,表明其具备内在的视觉泛化能力。
- 随着英语中句法依赖长度的增加,pixel 与 BERT 的性能差距也随之扩大,表明 pixel 在长距离句法结构上表现更弱。
- 尽管仅在约 0.05% 的非英文文本上进行预训练,pixel 仍能有效泛化至多语言任务,在各类书写系统上均保持一致的高性能。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。