Skip to main content
QUICK REVIEW

[論文レビュー] Language Modelling with Pixels

Phillip Rust, Jonas F. Lotz|arXiv (Cornell University)|Jul 14, 2022
Natural Language Processing Techniques参考文献 101被引用数 17
ひとこと要約

本稿では、テキストを画像としてレンダリングし、ビジョントランスフォーマーを用いてそれらを符号化することで語彙のボトルネックを回避する視覚ベースの言語モデル、pixelを提案する。これにより、サブワードトークン化に依存せず、多様な script における多言語間転移が可能になる。非ラテン script では BERT を上回り、表記のノイズやコードスイッチィングに対しても頑健であるが、ラテン script ではわずかに性能が劣り、長い文法的依存関係に対しては劣化が見られる。

ABSTRACT

Language models are defined over a finite set of inputs, which creates a vocabulary bottleneck when we attempt to scale the number of supported languages. Tackling this bottleneck results in a trade-off between what can be represented in the embedding matrix and computational issues in the output layer. This paper introduces PIXEL, the Pixel-based Encoder of Language, which suffers from neither of these issues. PIXEL is a pretrained language model that renders text as images, making it possible to transfer representations across languages based on orthographic similarity or the co-activation of pixels. PIXEL is trained to reconstruct the pixels of masked patches instead of predicting a distribution over tokens. We pretrain the 86M parameter PIXEL model on the same English data as BERT and evaluate on syntactic and semantic tasks in typologically diverse languages, including various non-Latin scripts. We find that PIXEL substantially outperforms BERT on syntactic and semantic processing tasks on scripts that are not found in the pretraining data, but PIXEL is slightly weaker than BERT when working with Latin scripts. Furthermore, we find that PIXEL is more robust than BERT to orthographic attacks and linguistic code-switching, further confirming the benefits of modelling language with pixels.

研究の動機と目的

  • 事前学習された言語モデルにおける語彙のボトルネックを解消することにより、多言語間一般化を促進し、埋め込み層と出力層設計におけるトレードオフを解消すること。
  • 有限なサブワードまたは文字語彙に依存せずに、ラテン以外の script を含む数千の言語をサポートすること。
  • 言語を視覚的表現によってモデル化することで、表記の変異、ノイズ、コードスイッチィングに対する頑健性を向上させること。
  • pixel ベースの符号化が、タイプロジカルに多様な言語間で強力なゼロショットおよびフェイントショット転移性能を達成できるかどうかを検討すること。

提案手法

  • テキストはフォントレンダラーを用いて固定サイズの画像パッチに変換され、入力シーケンスが視覚的トークンに変換される。
  • ビジョントランスフォーマー(ViT)エンコーダーが、学習可能なトークン埋め込み層を備えずに画像パッチを処理する。これにより語彙の制約が排除される。
  • モデルはマスクドオートエンコーダーを採用:事前学習中にランダムにマスクされた画像パッチが、軽量なデコーダーによって再構築される。
  • 直接比較を可能にするために、C4 データセットを用いて、BERT と同一の英語のみのデータで事前学習が実施される。
  • 微調整は、ViT エンコーダーの上に分類ヘッドを追加することで、下流の NLP タスクに適用される。
  • モデルは、ラテン以外の script を含む14の script を有する32の言語で、文法的および意味的タスクに対して評価される。

実験結果

リサーチクエスチョン

  • RQ1英語のみのテキストで学習した視覚ベースの言語モデルは、ラテン以外の script を有する言語に効果的に一般化できるか?
  • RQ2タイプロジカルに多様な言語をカバーする文法的および意味的タスクにおいて、pixel の性能は BERT や mBERT と比べてどうか?
  • RQ3サブワードベースのモデルと比較して、pixel は表記のノイズおよび言語的コードスイッチィングに対してどの程度頑健性を向上させているか?
  • RQ4pixel を用いた視覚的表現学習は、多言語 NLP における語彙のボトルネックを緩和するか?
  • RQ5依存関係の長さが、文法解析における pixel と BERT 間の性能差にどのように影響するか?

主な発見

  • pixel は、タイ語(LAS: 50.2 対 35.7) や中国語(LAS: 54.1 対 46.2) といった非ラテン script における文法的および意味的タスクで、BERT を顕著に上回る。
  • ラテン script では、pixel は BERT よりわずかに性能が劣り、英語における LAS の差は 6.5 ポints(77.2 対 83.7) であり、なじみのある script における性能のトレードオフを示している。
  • pixel は表記のノイズ攻撃およびコードスイッチィングに対して優れた頑健性を示し、視覚的表現学習の利点がノイズの多い入力に対して有効であることを確認した。
  • モデルは、未学習のフォントに対しても強いゼロショット転移を示し、データ拡張なしで高い性能を達成しており、内在的な視覚的一般化能力を示している。
  • 英語における長い文法的依存関係が、pixel と BERT 間の性能差を拡大させていることが判明した。これは、pixel が長距離の文法的構造に対してより困難を抱えることを示唆している。
  • 非英語テキストの約 0.05% のみで事前学習されたにもかかわらず、pixel は多言語タスクに効果的に一般化しており、各 script 間で一貫した性能を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。