Skip to main content
QUICK REVIEW

[論文レビュー] Cross-Lingual Syntactic Transfer through Unsupervised Adaptation of Invertible Projections

Junxian He, Zhisong Zhang|arXiv (Cornell University)|Jun 6, 2019
Natural Language Processing Techniques参考文献 36被引用数 4
ひとこと要約

本稿では、逆可換射影を用いた生成的クロスリンガル転送手法を提案し、遠く離れた言語表現を整列させ、ソース言語とターゲット言語間でソフトパラメータ共有を介して構文モデルを適応させる。ラベル付きソースデータとラベルなしターゲットデータを共有の間投的言語的潜在空間で同時に学習することで、10種類のタイプロジカルに異なる言語において、直接転送ベースライン比で品詞タグ付けで5.2%、依存解析で8.3%の絶対的向上を達成した。英語のみをソース言語として使用した。

ABSTRACT

Cross-lingual transfer is an effective way to build syntactic analysis tools in low-resource languages. However, transfer is difficult when transferring to typologically distant languages, especially when neither annotated target data nor parallel corpora are available. In this paper, we focus on methods for cross-lingual transfer to distant languages and propose to learn a generative model with a structured prior that utilizes labeled source data and unlabeled target data jointly. The parameters of source model and target model are softly shared through a regularized log likelihood objective. An invertible projection is employed to learn a new interlingual latent embedding space that compensates for imperfect cross-lingual word embedding input. We evaluate our method on two syntactic tasks: part-of-speech (POS) tagging and dependency parsing. On the Universal Dependency Treebanks, we use English as the only source corpus and transfer to a wide range of target languages. On the 10 languages in this dataset that are distant from English, our method yields an average of 5.2% absolute improvement on POS tagging and 8.3% absolute improvement on dependency parsing over a direct transfer method using state-of-the-art discriminative models.

研究の動機と目的

  • ラベル付きターゲットデータや並列コーパスが利用できない状況において、タイプロジカルに異なる言語へのクロスリンガル構文的転送の性能が低いという課題に対処すること。
  • ラベル付きソースデータとラベルなしターゲットデータを統合的にモデル化することで、ソフトパラメータ共有を有する構造的生成モデルを用いて転送性能を向上させること。
  • 遠く離れた言語ペairにおける不良な整列を補うために、クロスリンガル単語埋め込み間のより表現力があり、逆可換な変換を学習すること。
  • フォローフローに基づく生成モデルを用いた非教師あり適応の有効性を、品詞タグ付けと依存解析において示すこと。
  • 生成モデルに逆可換射影を組み込むことで、ゼロショット転送において判別的ベースラインを上回ることを実証的根拠として提供すること。

提案手法

  • 本手法は、ソース言語とターゲット言語の表現を整列させる共有の間投的言語的潜在空間を学習するために、逆可換射影(ノーマライジングフロー)を用いる。
  • ラベル付きソースデータとラベルなしターゲットデータを統合する尤度関数において、構造的事前分布(品詞タグ付けにはHMM、依存解析にはDMV)を組み込む。
  • 正則化された対数尤度関数によりソフトパラメータ共有を強制し、モデルがターゲット言語の構文および単語埋め込みの両方に同時に適応できるようにする。
  • ラベル付きソースデータとラベルなしターゲットデータを用いてエンドツーエンドでモデルを訓練することで、ターゲット言語の特性に非教師ありで適応可能にする。
  • 本手法は、Universal Dependencies Treebanks v2.2を用いて評価され、ソース言語として英語のみを用い、10種類の遠く離れたターゲット言語を対象とする。
  • 高速な単語埋め込み(fastText)とmBERTの両方を用いて実装し、文脈依存的表現の影響を評価する。

実験結果

リサーチクエスチョン

  • RQ1ラベル付きターゲットデータが利用できない状況において、逆可換射影を有する生成モデルは、遠く離れた言語へのクロスリンガル構文的転送を改善できるか?
  • RQ2逆可換射影を用いることで、線形射影と比較して、クロスリンガル構文的転送のモデリングにどのような差が出るか?
  • RQ3ラベルなしターゲットデータに対する非教師あり適応は、品詞タグ付けと依存解析の性能にどの程度向上をもたらすか?
  • RQ4本手法の性能向上は言語の距離に依存するか。その場合、どのような関係にあるか?
  • RQ5mBERTのような文脈依存的埋め込みは、フォローフローに基づく生成モデルのクロスリンガル転送性能をさらに向上させられるか?

主な発見

  • 提案手法は、10種類の遠く離れた言語において、強力な判別的ベースライン比で品詞タグ付けで平均5.2%、依存解析で8.3%の絶対的向上を達成した。
  • mBERT埋め込みを用いた場合、遠く離れた言語では、判別的ベースライン比で品詞タグ付けで平均6%の向上を達成した。fastTextを用いた場合は3%の向上であった。
  • mBERT埋め込みを用いた場合、10種類の近い言語のうち7つで判別的ベースラインを上回り、平均3%の向上を達成した。
  • mBERT埋め込みを用いたフォローフロー型モデルの性能は、fastTextを用いた場合と同程度であった。これは、現在の生成モデルが依存解析の文脈依存的埋め込みを十分に活用できていない可能性を示唆している。
  • 本手法は遠く離れた言語では顕著な向上を示したが、mBERTを用いた場合、一部の近い言語では判別的ベースラインに劣ることもあった。これは、言語の近さに応じたモデル選択のトレードオフを示している。
  • 結果から、文脈依存的埋め込みが生成モデルの独立性仮定を補完し、言語距離を問わずより良い性能を実現できる可能性があることが示唆された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。