Skip to main content
QUICK REVIEW

[論文レビュー] Generating Major Types of Chinese Classical Poetry in a Uniformed Framework

Jinyi Hu, Maosong Sun|arXiv (Cornell University)|Mar 13, 2020
Topic Modeling参考文献 13被引用数 5
ひとこと要約

本論文は、詩(絶句および律詩)および詞(121の頻出詞牌)を含む中国古典詩の主なタイプを一元的に出力するGPT-2ベースのフレームワークを提案する。形式に関する詳細な情報を標準化されたトレーニングフォーマットに統合し、形式に重点を置いた重み付け機構を適用することで、モデルは構造的正確性と一貫性を著しく向上させ、多様な詩的形式において高品質な出力を達成した。このフレームワークは清華大学の Jioge 詩生成システムで検証された。

ABSTRACT

Poetry generation is an interesting research topic in the field of text generation. As one of the most valuable literary and cultural heritages of China, Chinese classical poetry is very familiar and loved by Chinese people from generation to generation. It has many particular characteristics in its language structure, ranging from form, sound to meaning, thus is regarded as an ideal testing task for text generation. In this paper, we propose a GPT-2 based uniformed framework for generating major types of Chinese classical poems. We define a unified format for formulating all types of training samples by integrating detailed form information, then present a simple form-stressed weighting method in GPT-2 to strengthen the control to the form of the generated poems, with special emphasis on those forms with longer body length. Preliminary experimental results show this enhanced model can generate Chinese classical poems of major types with high quality in both form and content, validating the effectiveness of the proposed strategy. The model has been incorporated into Jiuge, the most influential Chinese classical poetry generation system developed by Tsinghua University (Guo et al., 2019).

研究の動機と目的

  • 多様な形式(詩および詞を含む)にわたり、構造的に正確な中国古典詩を生成する課題に対処すること。
  • 構造的ルールが異なる複数の詩的形式において、トレーニングデータの表現を統一すること。
  • GPT-2が、特に長編および複雑な形式(例:律詩、頻度の低い詞牌)における形式制約をよりよく制御できるようにすること。
  • 主な詩的タイプにおいて、形式的正確性と意味的一貫性の両方を向上させること。

提案手法

  • 各行の行数、1行あたりの文字数、声調パターン、対仗(対句)要件などの詳細な形式情報を、各トレーニングサンプルに埋め込む統一されたデータフォーマットを定義する。
  • GPT-2における自己回帰的生成中に形式関連トークンに注目を集中させる、形式に重点を置いた重み付け機構を導入する。
  • 構造的認識を高め、形式エラーを低減するために、入力シーケンスに段落区切りマーカーを組み込む。
  • CCPC1.0から抽出した834,902首の詩のコーディネートされたデータセットを用い、GPT-2を微調整する。主に121の頻出詞牌および主要な詩タイプに焦点を当てる。
  • 1つのモデルで複数の詩的タイプを出力可能とし、新しい形式へのゼロショットまたはフェイワショット適応を可能にする。
  • 清華大学の最先端の中国古典詩生成システムである Jioge でフレームワークを検証する。

実験結果

リサーチクエスチョン

  • RQ11つの統一フレームワークが、構造的正確性を高く保ちながら、多数の主要な中国古典詩のタイプを効果的に生成できるか?
  • RQ2GPT-2における形式に重点を置いた重み付け機構は、長編および声調や対仗の規則が厳しい複雑な詩的形式における制御性をどのように向上させるか?
  • RQ3入力フォーマットに段落区切りを組み込むことで、生成された詞詩における構造的エラーはどの程度低減されるか?
  • RQ4データが限られる低頻度の詞牌形式に対しても、モデルは一般化可能か?
  • RQ5多様な詩的タイプにわたり、形式的正確性と意味的一貫性の両立において、モデルの性能はどの程度か?

主な発見

  • 強化されたモデルは、『沁園春』という詞牌の詩を正しく生成する割合が、ベースラインの12.0%から55.0%に上昇し、形式的正確性の著しい向上を示した。
  • トレーニングフォーマットに段落区切りを組み込むことで、生成された詞詩における形式関連エラーが約20%低減され、強化モデルで生成されたすべての詩が期待される形式に一致した。
  • モデルは、奇言律詩や満江紅を含む、詩および詞の主要なタイプすべてにおいて、高品質で意味的に一貫性のある詩を成功裏に生成した。特に律詩では、対仗(対句)の適切な使用が確認された。
  • 定性的な事例研究を通じて、生成された詩に適切な意味的構造、主題の一貫性、芸術的表現が見られた。
  • フレームワークは、清華大学で最も影響力のある中国古典詩生成システムである Jioge に成功裏に統合され、実用的価値が裏付けられた。
  • 改善は見られたが、長編形式およびリソースが限られる詞牌形式における形式制御は依然として挑戦的であり、構造モデリングのさらなる洗練の余地があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。