Skip to main content
QUICK REVIEW

[論文レビュー] Code-switching Sentence Generation by Generative Adversarial Networks and its Application to Data Augmentation

Ching-Ting Chang, Shun-Po Chuang|arXiv (Cornell University)|Nov 6, 2018
Topic Modeling参考文献 26被引用数 8
ひとこと要約

本稿では、文脈的生成器を adversarial 学習で訓練することで、言語的ルールに依存せずに暗黙的にコードスイッチィングパターンを学習する GAN ベースの手法を提案する。この手法は、モノリンガルテキストから文内コードスイッチィング文を生成し、データ拡張を通じてコードスイッチィング言語モデルの性能を著しく向上させる。ドメイン特化コーパスにおいて、+pos 特徴統合が最も優れた結果をもたらした。

ABSTRACT

Code-switching is about dealing with alternative languages in speech or text. It is partially speaker-depend and domain-related, so completely explaining the phenomenon by linguistic rules is challenging. Compared to most monolingual tasks, insufficient data is an issue for code-switching. To mitigate the issue without expensive human annotation, we proposed an unsupervised method for code-switching data augmentation. By utilizing a generative adversarial network, we can generate intra-sentential code-switching sentences from monolingual sentences. We applied proposed method on two corpora, and the result shows that the generated code-switching sentences improve the performance of code-switching language models.

研究の動機と目的

  • ASR や NLP の低リソース環境におけるコードスイッチィング訓練データの不足に対処すること。
  • アノテーションデータや言語的ルールに依存しない、教師なしの方法で現実的かつ文内コードスイッチィング文を生成すること。
  • 生成された文を用いたデータ拡張により、コードスイッチィング言語モデルの性能を向上させること。
  • 言語的およびドメイン特性が異なる多様なコードスイッチィングコーパスにおいて、本手法の汎用性を評価すること。

提案手法

  • 条件付き生成対抗ネットワーク(cGAN)を用い、生成器がモノリンガル文をコードスイッチィング文に変換する。
  • 生成器は、本物のコードスイッチィング文と生成された文を区別するディスクラミネーターと adversarial 損失を用いて訓練され、より現実的な出力を得る。
  • 生成器は、より文脈的に適切なコードスイッチィング意思決定を支援するため、品詞(POS)タグを入力特徴として統合する。
  • モノリンガル文を入力とし、生成器は特定の語やフレーズをゲスト言語(例:中国語から英語)への翻訳に置き換えることで、コードスイッチィングを実現する。
  • より良いコードスイッチィングポイント選択を実現するため、強化学習を用いて生成器のポリシーを最適化する。
  • 元の訓練データと生成されたコードスイッチィング文を組み合わせることでデータ拡張を実施し、改善された言語モデルを訓練する。

実験結果

リサーチクエスチョン

  • RQ1言語的ルールを明示的に指定せずに、モノリンガル入力から妥当な文内コードスイッチィング文を生成できるか?
  • RQ2POS 特徴の統合が、生成されたコードスイッチィング文の品質および実用性に与える影響は何か?
  • RQ3生成されたコードスイッチィング文を用いたデータ拡張が、下流の言語モデル性能にどの程度向上効果をもたらすか?
  • RQ4本手法は、言語的パターンやドメイン特性が異なる多様なコードスイッチィングコーパスにどの程度汎用的に適用可能か?

主な発見

  • POS タギングを統合した本手法(proposed+pos)は、SEAME テストセットで最小のパープレキシティ 69.185 を達成し、ランダムおよびルールベースのベースラインを上回った。
  • LectureSS コーパスでは、proposed+pos 法がテストパープレキシティを 69.185 まで低下させ、RNNLM ベースライン(71.974)より 4.1% 減少、ランダムベースライン(71.779)より 3.0% 減少した。
  • 本手法は、学術的レクチャーテキスト(LectureSS)と日常会話(SEAME)という2つの異なるコーパスにおいても良好に一般化しており、ドメイン差異に対して高いロバストネスを示した。
  • LectureSS では、内容特化語彙が頻繁にコードスイッチされるとの特徴から、POS 特徴の統合が性能向上に寄与したが、SEAME では語彙的多様性が高いため、その影響は限定的であった。
  • ランダムなコードスイッチィングポイント選択ですら、ベースラインよりパープレキシティが改善されており、データ拡張自体に効果があることを示唆するが、本手法はより顕著な向上をもたらした。
  • 生成された文は大多数のケースで質的に妥当であったが、失敗の主な原因は中国語から英語への翻訳品質の低さに起因した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。