[論文レビュー] Zero-Shot Paraphrase Generation with Multilingual Language Models
本稿では、ループ翻訳に依存せずに、平行コーパスに直接学習する多言語言語モデルを用いた、1段階でエンドツーエンドに零-shotの言い換え生成を行うモデルを提案する。変換器ベースのアーキテクチャにGPT風の事前学習とノイズ除去自己符号化を組み合わせることで、ピvォティング手法に比べて優れた関連性、流暢さ、多様性を達成するとともに、推論コストと意味的ずれを低減する。
Leveraging multilingual parallel texts to automatically generate paraphrases has drawn much attention as size of high-quality paraphrase corpus is limited. Round-trip translation, also known as the pivoting method, is a typical approach to this end. However, we notice that the pivoting process involves multiple machine translation models and is likely to incur semantic drift during the two-step translations. In this paper, inspired by the Transformer-based language models, we propose a simple and unified paraphrasing model, which is purely trained on multilingual parallel data and can conduct zero-shot paraphrase generation in one step. Compared with the pivoting approach, paraphrases generated by our model is more semantically similar to the input sentence. Moreover, since our model shares the same architecture as GPT (Radford et al., 2018), we are able to pre-train the model on large-scale unparallel corpus, which further improves the fluency of the output sentences. In addition, we introduce the mechanism of denoising auto-encoder (DAE) to improve diversity and robustness of the model. Experimental results show that our model surpasses the pivoting method in terms of relevance, diversity, fluency and efficiency.
研究の動機と目的
- 高品質な言い換えコーパスの不足を解消し、並列言い換えデータを必要としない零ショット言い換え生成を可能にすること。
- 複数の翻訳システムに依存する2段階のループ翻訳パイプラインに内在する意味的ずれと非効率性を克服すること。
- 大規模な単語語彙の事前学習とノイズ除去自己符号化を活用して、生成される言い換えの流暢さと多様性を向上させること。
- 多言語並列データから直接言い換え分布を学習する統合的でエンドツーエンドのモデルを構築すること。
- 単語語彙の事前学習からの転移学習を通じて、低リソース言語においても効果的な零ショット言い換え生成を実現すること。
提案手法
- 言語固有のトークンを用いて連結された双方向並列文に、変換器ベースのデコーダ言語モデルを訓練することで、多言語理解と生成を可能にする。
- 大規模な単語語彙コーパスを用いたGPT風の自己回帰的事前学習により、特に低リソース言語において流暢さと一般化性能を向上させる。
- 事前学習段階でノイズ除去自己符号化(DAE)機構を導入し、入力トークンをマスキングして再構築することで、耐性と多様性を向上させる。
- 推論時、入力文を元言語で条件付け、自己回帰的デコーディングを用いて同じ言語での言い換えを生成する。
- 並列コーパスにおける元文と対応文の同時分布に対して、最大尤度推定を用いてエンドツーエンドで最適化する。
- 温度サンプリングによる生成の多様性制御と、BLEUやDistinct-2などの自動評価指標を用いた関連性と流暢さのバランス調整を行う。
実験結果
リサーチクエスチョン
- RQ1多言語並列データにエンドツーエンドで学習した統合的モデルは、標準的なループ翻訳法に比べ、零ショット言い換え生成において優れているか?
- RQ2単語語彙の事前学習が、低リソース言語における流暢さと零ショット性能をどの程度向上させるか?
- RQ3ノイズ除去自己符号化の統合が、生成される言い換えの多様性と耐性に与える影響は何か?
- RQ42段階のピボット法と比較して、提案手法は意味的ずれを低減するか?
- RQ5言語固有の言い換えデータに対する微調整なしに、複数の言語にわたって効果的に一般化できるか?
主な発見
- 自動評価および人間評価の両方において、本モデルは関連性、流暢さ、多様性、効率性の面で、ループ翻訳ベースラインを顕著に上回っている。
- 人間評価では、本モデルの言い換えはピボット法で生成されたものよりも入力文とより意味的に類似しており、意味的ずれが低減されている。
- 本モデルはより高いDistinct-2スコアと低い逆自己BLEUを達成しており、より優れた語彙的多様性と繰り返しの低減を示している。
- GPT風の事前学習の使用により、追加の微調整なしに、特に低リソース言語において流暢さが向上している。
- ノイズ除去自己符号化機構により、意味的関連性を損なわず、耐性と多様性が向上している。
- 2段階のデコーディングと複数の翻訳システムを回避するため、ピボット法よりも推論が高速かつ効率的である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。