Skip to main content
QUICK REVIEW

[論文レビュー] Learning to Look Inside: Augmenting Token-Based Encoders with Character-Level Information

Yuval Pinter, Amanda Stent|arXiv (Cornell University)|Aug 1, 2021
Topic Modeling参考文献 29被引用数 5
ひとこと要約

本論文では、文字レベルのエンコーダと生成デコーダを統合することで、事前学習されたトランスフォーマーモデルに文字レベル表現を組み込むXRayEmbという手法を提案する。これにより、まれな語、未知語(OOV)、非標準語の処理が向上し、ベースモデルを再訓練せずに、特に序列タグ付けタスクにおける性能向上が達成される。

ABSTRACT

Commonly-used transformer language models depend on a tokenization schema which sets an unchangeable subword vocabulary prior to pre-training, destined to be applied to all downstream tasks regardless of domain shift, novel word formations, or other sources of vocabulary mismatch. Recent work has shown that "token-free" models can be trained directly on characters or bytes, but training these models from scratch requires substantial computational resources, and this implies discarding the many domain-specific models that were trained on tokens. In this paper, we present XRayEmb, a method for retrofitting existing token-based models with character-level information. XRayEmb is composed of a character-level "encoder" that computes vector representations of character sequences, and a generative component that decodes from the internal representation to a character sequence. We show that incorporating XRayEmb's learned vectors into sequences of pre-trained token embeddings helps performance on both autoregressive and masked pre-trained transformer architectures and on both sequence-level and sequence tagging tasks, particularly on non-standard English text.

研究の動機と目的

  • 事前学習された言語モデルにおけるサブワードトークン化の限界、特にドメインシフトやまれな語・スペルミス語に対しての課題を解決すること。
  • 固定されたサブワード語彙の不可逆性に起因する、新ドメインや言語的変化への適応困難を克服すること。
  • ベースモデルを再訓練せずに、既存の事前学習モデルが文字レベル表現の恩恵を受ける仕組みを提供すること。
  • 特に非標準英語テキストにおける、序列および序列タグ付けタスクの性能向上を図ること。
  • 主なトークンベースモデルに補助的コンponentを統合する軽量でリターゲティングベースの手法を開発すること。

提案手法

  • XRayEmbは、文字列から密なベクトル表現を計算する文字レベルエンコーダ(XR-Enc)を導入する。
  • 生成デコーダ(XR-Dec)は、XR-Encが生成する文脈化された表現からターゲット語を再構成する学習を行う。
  • システムはサイクルとして事前学習される:XR-Encが文字をベクトルに符号化し、XR-Decがそれを元のシーケンスに復元することで、自己教師付きループを形成する。
  • 文字レベルのコンponentは、下流タスクの適応段階でメイントランスフォーマーモデルと同時に微調整される。
  • 語の境界を示すために予約済みのエンド・オブ・ワードトークン(/w)を用い、マスク型および自己回帰型トランスフォーマー両方のアーキテクチャをサポートする。
  • トレーニングプロセスには、ドメイン固有のデータ(例:Twitter)で第二段階の事前学習フェーズが含まれ、文字モジュールを新しい分布に適応させる。

実験結果

リサーチクエスチョン

  • RQ1既存の事前学習済みトークンベースモデルにリターゲティングで統合された文字レベル表現が、下流NLPタスクの性能向上に寄与するか?
  • RQ2XRayEmbは、標準的でない語を含む序列タグ付けタスクにおいて、標準的な事前学習モデルと比較してどのように性能を発揮するか?
  • RQ3ドメインシフトがXRayEmbの性能に与える影響は何か?また、新しいデータ分布への適応力はどの程度か?
  • RQ4サイクル依存性ループや接尾語ベース推論といった個々のコンponentが、全体のモデル性能にどのように寄与しているか?
  • RQ5メイントランスフォーマーモデルを再訓練せずに、XRayEmbが性能向上をどの程度達成できるか?

主な発見

  • XRayEmbは、BERT、RoBERTa、GPT2の全モデルにおいて、特にソーシャルメディアテキストのような非標準英語において、序列タグ付け性能を向上させる。
  • メインモデルとXRayEmbコンponentを両方微調整する方が、特徴抽出のみに比べて優れた結果を示しており、文字モジュールの適応可能性が裏付けられる。
  • ドメイン固有のデータ(例:Twitter)でXRayEmbをトレーニングすると、Wikipediaデータを用いた場合に比べて顕著に性能が向上し、NYTWITタスクにおいてBERTで3.11ポイントの向上を達成した。
  • サイクル依存性ループを削除すると、BERTおよびGPT2では性能が向上するが、RoBERTaでは悪化する。これは、アーキテクチャに依存する感度の存在を示唆する。
  • 事前学習段階での接尾語ベース推論は、マスク型モデルには役立つが、左から右への生成制約を持つ自己回帰型GPT2では逆効果である。これは、生成の制約に起因すると考えられる。
  • XRayEmbは、序列タグ付けタスクにおいて測定可能な向上を達成するとともに、序列タスクの性能を維持するため、強靭性と転移性を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。