Skip to main content
QUICK REVIEW

[論文レビュー] Code-switched inspired losses for generic spoken dialog representations

Émile Chapuis, Pierre Colombo|arXiv (Cornell University)|Aug 27, 2021
Topic Modeling参考文献 103被引用数 11
ひとこと要約

本稿では、OpenSubtitlesから自動的に構築された多言語会話データを活用して、汎用的な多言語スプokenダイアログ表現を学ぶために、コードスイッチングにインspiredされた事前学習損失を導入する。提案手法は、単言語および多言語の下流タスクにおいて顕著な性能向上を達成し、mBERTおよび他のベースラインより、多言語ダイアログアクティビティ認識およびクロスリンガル発話検索の新規ベンチマークで優れた性能を示す。

ABSTRACT

Spoken dialog systems need to be able to handle both multiple languages and multilinguality inside a conversation ( extit{e.g} in case of code-switching). In this work, we introduce new pretraining losses tailored to learn multilingual spoken dialog representations. The goal of these losses is to expose the model to code-switched language. To scale up training, we automatically build a pretraining corpus composed of multilingual conversations in five different languages (French, Italian, English, German and Spanish) from exttt{OpenSubtitles}, a huge multilingual corpus composed of 24.3G tokens. We test the generic representations on exttt{MIAM}, a new benchmark composed of five dialog act corpora on the same aforementioned languages as well as on two novel multilingual downstream tasks ( extit{i.e} multilingual mask utterance retrieval and multilingual inconsistency identification). Our experiments show that our new code switched-inspired losses achieve a better performance in both monolingual and multilingual settings.

研究の動機と目的

  • 既存のモデルが多言語およびコードスイッチドスプーケンダイアログを処理する能力に制限を抱えることに対処する。
  • 発話レベルでコードスイッチングを明示的にモデル化する事前学習目的を考案し、多言語表現学習を向上させる。
  • OpenSubtitlesから得られる大規模かつ自動的に構築された多言語会話コーパスを用いて、事前学習をスケーリングアップする。
  • 提案手法を、新規の多言語ダイアログアクティビティベンチマーク(MIAM)および2つの新規の多言語タスク(多言語マスク発話検索および不整合特定)で評価する。
  • コードスイッチングにインスパイアされた損失が、単言語および多言語設定の両方でより良い一般化性能をもたらすことを示す。

提案手法

  • コードスイッチングのパターンにインspiredされた3つの新規事前学習目的(mMUG:多言語マスク発話生成、mHR:多言語次発話リtrieval、TMUG:時系列的多言語発話生成)を提案する。
  • 5言語(en, fr, de, es, it)の既存の文レベルアライメントを活用して、OpenSubtitlesから大規模な多言語会話コーパスを自動的に構築する。
  • 単一のエンコーダデコーダフレームワーク内で、言語間の文脈を共有アテンション機構を用いてモデル化するため、シーケンス・トゥ・シーケンスアーキテクチャを採用する。
  • 発話を異なる言語からマスクし、多言語文脈内で予測する階層的マスキング戦略を適用し、コードスイッチング行動を模倣する。
  • 発話のマスク予測、次発話リtrieval、時系列的一致性の3つの目的を組み合わせて学習することで、言語間のディコーストリー的依存関係を捉える。
  • 対応する表現を、単言語および多言語の下流タスク(ダイアログアクティビティ分類およびクロスリンガル発話検索など)で微調整する。

実験結果

リサーチクエスチョン

  • RQ1コードスイッチングにインスパイアされた事前学習損失は、多言語設定における汎用的スプーケンダイアログ表現の質を向上させることができるか?
  • RQ2事前学習段階でコードスイッチングパターンを含む多言語会話にさらされることで、単言語および多言語の下流タスクの性能にどのような影響を与えるか?
  • RQ3OpenSubtitlesから自動的に構築された大規模な多言語会話コーパスは、多言語ダイアログ理解のための事前学習を効果的に支援できるか?
  • RQ4複数の多言語事前学習目的を組み合わせることで、個別の目的を使用する場合よりも一般化性能が向上するか?
  • RQ5提案された損失は、多言語マスク発話検索や不整合検出といった新規の多言語タスクにおいて、どの程度性能を向上させるか?

主な発見

  • 提案手法である mMUG+TMUG+MMUG は、多言語ダイアログアクティビティベンチマーク(MIAM)で最高の性能を達成し、ドイツ語テストセットで70.2%のR@5スコアを記録。mBERTを4.1ポイント上回った。
  • 多言語次発話リtrieval(mNUR)タスクでは、最良のモデルが英仏クロスリンガル設定で64.0%のR@5スコアを達成。mBERTに比べ6.1ポイントの向上を示した。
  • 3つの損失をすべて組み合わせたモデル(mMUG+TMUG+MMUG)は、多言語不整合特定タスクで68.3%のR@5スコアを達成し、言語ペア間での強力な一般化性能を示した。
  • mBERTおよびmBERT(4層)を含むすべての単言語および多言語評価タスクで、提案手法は優れた性能を示し、ゼロショットおよびフェイシュット設定の両方で一貫した向上を確認した。
  • アブレーションスタディの結果、3つの損失を組み合わせた場合が最良の性能を示し、TMUGおよびMMUGが多言語理解およびクロスリンガル転送に顕著な貢献を果たしていることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。