Skip to main content
QUICK REVIEW

[論文レビュー] Neural Machine Translation with Byte-Level Subwords

Changhan Wang, Kyunghyun Cho|arXiv (Cornell University)|Sep 7, 2019
Natural Language Processing Techniques参考文献 29被引用数 9
ひとこと要約

本稿では、UTF-8バイトを基本単位とするバイトレベルのBPE(BBPE)を提案する。これは、文字レベルのBPEと比較して語彙サイズを1/8に削減しながらも、同等の翻訳性能を達成する。BBPE埋め込みを畳み込み層または再帰層で文脈化することで、効率的で未知語なしの翻訳が可能となり、文字セットが重複しない言語間での転移学習が可能となり、ゼロショット適応が顕著に向上する。

ABSTRACT

Almost all existing machine translation models are built on top of character-based vocabularies: characters, subwords or words. Rare characters from noisy text or character-rich languages such as Japanese and Chinese however can unnecessarily take up vocabulary slots and limit its compactness. Representing text at the level of bytes and using the 256 byte set as vocabulary is a potential solution to this issue. High computational cost has however prevented it from being widely deployed or used in practice. In this paper, we investigate byte-level subwords, specifically byte-level BPE (BBPE), which is compacter than character vocabulary and has no out-of-vocabulary tokens, but is more efficient than using pure bytes only is. We claim that contextualizing BBPE embeddings is necessary, which can be implemented by a convolutional or recurrent layer. Our experiments show that BBPE has comparable performance to BPE while its size is only 1/8 of that for BPE. In the multilingual setting, BBPE maximizes vocabulary sharing across many languages and achieves better translation quality. Moreover, we show that BBPE enables transferring models between languages with non-overlapping character sets.

研究の動機と目的

  • 日本語や中国語のような低リソース・文字豊富言語において、文字レベルサブワードトークン化が引き起こす非効率性と語彙の肥大化を解消すること。
  • 文字レベルBPEの代替として、よりコンパクトで言語に依存しないバイトレベルサブワードセグメンテーションの可能性を検討すること。
  • 語彙に重複のない文字セットを持つ言語間で、未知語トークンを排除することでモデル転移を可能にすること。
  • BBPEの性能と効率を、二言語、多言語、ゼロショット転移学習の設定で評価すること。

提案手法

  • テキストをUTF-8エンコーディングで0–255のバイト列に変換し、基本語彙を構築する。
  • バイトレベルBPE(BBPE)は、バイト列に対して学習され、可変長のバイトn-gramをサブワードユニットとして生成する。
  • BBPE埋め込みは、深さ方向の畳み込み層または双方向GRUを用いて文脈化され、表現学習が向上する。
  • 動的計画法に基づくデコードアルゴリズムにより、バイト列から有効なUnicode文字列が復元され、出力の正しさが保証される。
  • モデルは、BBPEトークン化と文脈化された埋め込みを用いたTransformerアーキテクチャで訓練される。
  • 転移学習は、元の語彙に重複する文字を持たない言語(シンハラ語)に対して、多言語X-Enモデルを微調整することで評価される。

実験結果

リサーチクエスチョン

  • RQ1バイトレベルサブワードトークン化は、文字レベルBPEと同等の翻訳品質を達成しつつ、語彙サイズを削減できるか?
  • RQ2畳み込みまたはRNNによるBBPE埋め込みの文脈化は、モデル性能を向上させるか?
  • RQ3BBPEベースのモデルは、語彙に重複のない文字セットを持つ言語に効果的に転移可能か?
  • RQ4多言語翻訳設定において、BBPEは文字レベルBPEよりも優れた性能を示すか?
  • RQ5短い入力シーケンスによる短縮効果から、BBPEはトレーニングおよび推論の効率にどのような影響を与えるか?

主な発見

  • BBPEはBPEと同等のBLEUスコアを達成しながら語彙サイズを1/8に削減し、英語-ドイツ語翻訳においてBBPE 4KがBPE 8Kの性能に相当する。
  • 多言語X-En設定では、全テストセット(165K例)でBLEUスコア31.61を達成し、平均的および低リソース言語の両方でBPEを上回った。
  • 多言語X-Enモデルからシンハラ語-英語(Si-En)への転移学習により、0.9–1.8のBLEUポイントの向上が得られ、語彙が重複しない文字セット間での効果的なゼロショット適応が実証された。
  • BiGRUまたは深さ方向畳み込みによる文脈化を施したBBPEモデルは、原始的なBBPE埋め込みよりも性能が向上し、文脈モデリングの必要性が確認された。
  • BBPEは文字レベルトークン化と比較してシーケンス長を短縮し、入力シーケンスの短縮に起因してトレーニングおよび推論が高速化された。
  • 推論において無効なUTF-8出力は極めて稀であり、動的計画法デコードアルゴリズムにより、一意な解を持つ有効な文字列が正常に復元された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。