Skip to main content
QUICK REVIEW

[論文レビュー] Improving Chinese Story Generation via Awareness of Syntactic Dependencies and Semantics

Henglin Huang, Chen Tang|arXiv (Cornell University)|Oct 19, 2022
Topic Modeling被引用数 7
ひとこと要約

本稿では、依存関係タグ付けと同義語ノイズ除去学習を用いて構文的依存関係解析と意味的表現学習を向上させる、中国語物語生成のための新規フレームワークを提案する。LongLMベースの生成器と統合することで、BLEU-n や総合スコアといった主要指標で最大10%の向上を達成し、低区切り記号の中国語テキストにおける言語的特徴の捉え込みの利点を示している。

ABSTRACT

Story generation aims to generate a long narrative conditioned on a given input. In spite of the success of prior works with the application of pre-trained models, current neural models for Chinese stories still struggle to generate high-quality long text narratives. We hypothesise that this stems from ambiguity in syntactically parsing the Chinese language, which does not have explicit delimiters for word segmentation. Consequently, neural models suffer from the inefficient capturing of features in Chinese narratives. In this paper, we present a new generation framework that enhances the feature capturing mechanism by informing the generation model of dependencies between words and additionally augmenting the semantic representation learning through synonym denoising training. We conduct a range of experiments, and the results demonstrate that our framework outperforms the state-of-the-art Chinese generation models on all evaluation metrics, demonstrating the benefits of enhanced dependency and semantic representation learning.

研究の動機と目的

  • 構文的曖昧さと語彙区切り記号の欠如により、中国語の長文物語生成が困難であるという課題に対処すること。
  • 中国語における形態的曖昧さのため、特定しにくい構文的依存関係(例:主語、目的語)を神経ネットワークモデルが捉える能力を向上させること。
  • 同義語表現を認識できるようにモデルを訓練することで意味的耐性を高め、意味的に同等だが語彙的に異なる表現による混乱を低減すること。
  • 依存関係タグ付けと意味的ノイズ除去を統合したデータ拡張フレームワークを構築し、中国語における言語理解と生成品質を向上させること。
  • 構文的および意味的特徴の明示的モデリングが、物語の一貫性、自然さ、多様性の向上に顕著な効果をもたらすことを実証すること。

提案手法

  • 本フレームワークは、中国語文のキーストリング的役割(例:nsubj, dobj, root)を特定するため、HanLPを用いて依存関係解析を実施し、文の出来事の構造的表現を可能にする。
  • 依存関係タグモジュールは、入力物語にターゲットラベル(nsubj, root, dobj, pobj)を挿入し、生成器が構文的構造を理解できるようにガイドする。
  • SimBertに基づく意味的ノイズ除去モジュールは、同義語表現(例:'遊覧'、'周遊'、'巡礼' は 'travelling' に対応)を用いて入力フレーズの言い換え版を生成し、モデルが頑健な意味的表現を学習できるようにする。
  • 条件付き生成器として、LongLMベース(223Mパラメータ)を用い、入力アウトラインに加え、依存関係および意味的信号を統合した条件付き生成を実現する。
  • トレーニング中に依存関係タグ付けと意味的ノイズ除去を統合し、構文的認識力と意味的一般化能力を同時に向上させる。
  • LOTベンチマーク上で微調整を行い、BLEU-n、Distinct-n、Coverage、Order指標を用いて評価することで、自然さ、多様性、入力アウトラインとの整合性を評価する。

実験結果

リサーチクエスチョン

  • RQ1構文的依存関係の明示的モデリングは、生成された中国語物語の一貫性と自然さを向上させることができるか?
  • RQ2同義語置換による意味的ノイズ除去は、中国語物語生成の耐性と多様性を向上させるか?
  • RQ3構文的および意味的認識メカニズムを併用した場合、片方のメカニズムのみ、あるいは両方を無視するモデルと比較して、どの程度優れているか?
  • RQ4SOTAモデルと比較して、本フレームワークは中国語物語生成の自動評価指標においてどの程度優れているか?
  • RQ5依存関係解析と意味的ノイズ除去の統合は、中国語の形態的曖昧さに起因する課題を緩和できるか?

主な発見

  • 提案モデルは、検証セットおよびテストセットの両方で、BLEU-n や総合スコアといった複数の指標において、SOTAのLongLM largeモデルを最大10%上回る性能を達成した。
  • パrameter数が少ないにもかかわらず、LongLM baseと比較して総合スコアで10%の性能向上を達成し、顕著な向上を示した。
  • Coverageスコアが向上し、特に入力が順序なしである状況下でも、生成物語と入力アウトラインフレーズとの整合性が高まった。
  • Orderスコアが向上し、入力フレーズの位置順序を物語内でよりよく保持していることが示され、物語の話法的一致性が向上した。
  • Distinct-nスコアが向上し、意味的ノイズ除去モジュールが生成テキストの多様性を顕著に向上させたことが示された。
  • アブレーションスタディにより、依存関係タグ付けと意味的ノイズ除去の両方が独立してかつ相乗的に寄与しており、全モデルがほとんどの指標で、すべてのアブレーションバリアントを上回ることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。