Skip to main content
QUICK REVIEW

[論文レビュー] MulZDG: Multilingual Code-Switching Framework for Zero-shot Dialogue Generation

Yongkang Liu, Feng Shi|arXiv (Cornell University)|Aug 18, 2022
Topic Modeling被引用数 5
ひとこと要約

MulZDG は、英語単一言語データに多言語のコードスイッチド発話文を追加してトレーニングすることで、統合モデルを用いたゼロショット対話生成を可能にする多言語コードスイッチングフレームワークである。低リソース言語においても競争力のあるパフォーマンスを達成し、言語間の暗黙的な意味的整合性により、人間評価でモノリンガルベースラインを最大6%上回るソース言語のパフォーマンス向上を実現する。

ABSTRACT

Building dialogue generation systems in a zero-shot scenario remains a huge challenge, since the typical zero-shot approaches in dialogue generation rely heavily on large-scale pre-trained language generation models such as GPT-3 and T5. The research on zero-shot dialogue generation without cumbersome language models is limited due to lacking corresponding parallel dialogue corpora. In this paper, we propose a simple but effective Multilingual learning framework for Zero-shot Dialogue Generation (dubbed as MulZDG) that can effectively transfer knowledge from an English corpus with large-scale training samples to a non-English corpus with zero samples. Besides, MulZDG can be viewed as a multilingual data augmentation method to improve the performance of the resource-rich language. First, we construct multilingual code-switching dialogue datasets via translation utterances randomly selected from monolingual English datasets. Then we employ MulZDG to train a unified multilingual dialogue model based on the code-switching datasets. The MulZDG can conduct implicit semantic alignment between different languages. Experiments on DailyDialog and DSTC7 datasets demonstrate that MulZDG not only achieve competitive performance under zero-shot case compared to training with sufficient examples but also greatly improve the performance of the source language.

研究の動機と目的

  • トレーニングデータが不足する低リソース言語向けにゼロショット対話生成の課題に対処すること。
  • ゼロショットターゲット言語とリソース豊富なソース言語の両方のパフォーマンスを向上させるデータ拡張手法の開発。
  • 並列単一言語コーパスを必要とせずに、言語間の暗黙的な意味的整合性を実現すること。
  • DailyDialog および DSTC7 のための多言語コードスイッチド対話データセットを構築・公開すること。
  • 多言語コードスイッチングが、対話生成における有効なゼロショット転移学習メカニズムとして機能できることを実証すること。

提案手法

  • NMTおよび二国語辞書を用いて、英語単一言語コーパス(DailyDialog、DSTC7)のランダム発話文をターゲット言語に翻訳し、多言語コードスイッチド対話データセットを構築する。
  • コードスイッチドデータ上でエンコーダ・デコーダアーキテクチャを用いて統合型多言語対話モデルをトレーニングし、言語間の共同学習を可能にする。
  • モデルが言語間でパラメータを共有するマルチタスク学習構造を採用し、共有された意味的表現を促進する。
  • 文単位のコードスイッチングを用いて、並列文ペアを必要とせずに、ソース言語とターゲット言語間の暗黙的な意味的整合性を実現する。
  • 言語間で注意メカニズムと表現学習を共有することで、入力プロンプトに基づき複数言語で応答を生成できるモデルの能力を活用する。
  • 学習済み表現を可視化・分析し、意味的に同等の発話文が言語間でクラスタリングされていることを確認することで、効果的なクロスリンガル整合性を検証する。

実験結果

リサーチクエスチョン

  • RQ1高リソース言語(英語)から低リソース言語への知識転送を、ゼロショット学習で効果的に行えるか?
  • RQ2コードスイッチドトレーニングデータに含まれるターゲット言語の数が、ゼロショット生成におけるモデルパフォーマンスに与える影響は?
  • RQ3マルチリンガルコードスイッチングフレームワークは、モノリンガル学習と比較して、ソース言語(英語)のパフォーマンスをどの程度向上させるか?
  • RQ4並列コーパスを必要とせずに、モデルが異なる言語間でどのように暗黙的な意味的整合性を実現しているか?
  • RQ5マルチリンガル表現学習は、ゼロショット設定における応答の流暢さと関連性にどのような影響を与えるか?

主な発見

  • MulZDG は、モノリンガルベースラインと比較して、人間評価でターゲット言語のゼロショットパフォーマンスを最大5%向上させ、効果的な知識転送を実証した。
  • コードスイッチドデータを用いることで、DailyDialog では平均して6.0%、DSTC7 では3.5%高い人間評価スコアを達成した。
  • コードスイッチドトレーニングデータに含まれる言語数が増えるほど、ゼロショットターゲット言語のパフォーマンスが向上し、スケーラビリティが示された。
  • 表現の可視化により、意味的に同等の発話文が言語間でクラスタリングされていることが確認され、暗黙的な意味的整合性が妥当であることが裏付けられた。
  • モデルは、Rouge-L で1.57%、平均埋め込みスコアで0.62%向上させることで、ソース言語(英語)のパフォーマンスを向上させ、低リソース言語と高リソース言語の両方に利益をもたらした。
  • 多言語評価において、BLEU-1 で0.91%、Rouge-L で1.57%、dist-1 で0.44%高い自動評価指標スコアを達成し、強い自動指標の向上を示した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。