Skip to main content
QUICK REVIEW

[論文レビュー] CCPM: A Chinese Classical Poetry Matching Dataset

Wenhao Li, Fanchao Qi|arXiv (Cornell University)|Jun 3, 2021
Topic Modeling参考文献 7被引用数 6
ひとこと要約

本稿では、現代中国語の翻訳文とその元の詩的文を照合することで、モデルの古典的中国詩における意味理解能力を評価することを目的とした、CCPM(中国古典詩照合データセット)を紹介する。二か国語並列データと、BERTベースの検索を用いたネガティブサンプルの生成により、BERT-Clsでは84.96%の精度を達成し、中国古典詩生成・理解システムにおける意味理解のベンチマークを確立した。

ABSTRACT

Poetry is one of the most important art forms of human languages. Recently many studies have focused on incorporating some linguistic features of poetry, such as style and sentiment, into its understanding or generation system. However, there is no focus on understanding or evaluating the semantics of poetry. Therefore, we propose a novel task to assess a model's semantic understanding of poetry by poem matching. Specifically, this task requires the model to select one line of Chinese classical poetry among four candidates according to the modern Chinese translation of a line of poetry. To construct this dataset, we first obtain a set of parallel data of Chinese classical poetry and modern Chinese translation. Then we retrieve similar lines of poetry with the lines in a poetry corpus as negative choices. We name the dataset Chinese Classical Poetry Matching Dataset (CCPM) and release it at https://github.com/THUNLP-AIPoet/CCPM. We hope this dataset can further enhance the study on incorporating deep semantics into the understanding and generation system of Chinese classical poetry. We also preliminarily run two variants of BERT on this dataset as the baselines for this dataset.

研究の動機と目的

  • 中国古典詩における意味理解を評価するためのベンチマークの不足に対処すること。
  • モデルが現代中国語の翻訳文とその元の詩的文を正しく対応付ける能力をテストする、新しい詩照合タスクを設計すること。
  • 二か国語並列データと意味的に類似したネガティブ例を用いて、大規模かつ高品質なデータセットを構築すること。
  • 詩生成・分析システムにおける意味モデリングの改善のためのベンチマークを提供すること。
  • 現代中国語と古典的中国語の間の意味的ギャップを埋め、より良いユーザー意図の一致を実現すること。

提案手法

  • Webソースから31,000組の中国古典詩と現代中国語翻訳の二か国語ペアを収集する。
  • 行分割とフォーマットフィルタリングを適用し、5文字および7文字の行を持つ詩(1行および2行のインスタンスを含む)のみを保持する。
  • 事前学習済みのBERT-CCPoemモデルを用いて、詩行間の意味的類似度を計算し、ネガティブサンプルを検索する。
  • 類似度検索を高速化するために局所性に敏感なハッシュ(LSH)を採用し、類似度上位k件の行をネガティブ候補として抽出する。
  • BERT埋め込み類似度と最長共通部分列(LCS)スコアの重み付き組み合わせを用いて、候補を再順序付けする。
  • 正例として最も類似度の高い行を、負例として上位2–5位および6–10位の候補からそれぞれ2つ選択し、その後シャッフルして学習用に構築する。

実験結果

リサーチクエスチョン

  • RQ1モデルは、中国古典詩の現代中国語訳文を、対応する元の詩的文に正確に照合できるか?
  • RQ2BERTのような事前学習言語モデルは、中国古典詩の深い意味をどれほど的確に捉えられるか?
  • RQ3モデルアーキテクチャの違い(例:連結法対文のペアマッチング)が、詩照合性能に与える影響は何か?
  • RQ4BERTベースの意味表現は、古典詩における微細な意味的差異をどれほど的確に区別できるか?
  • RQ5リtrieバルベースのネガティブサンプル生成は、照合タスクの難易度と現実性をどれほど向上させるか?

主な発見

  • BERT-Clsモデルはテストセットで84.96%の最高精度を達成し、BERT-Matchを上回った。
  • BERT-Matchモデルは82.60%の精度を達成し、直接的な文のペアマッチングが有効であるものの、連結による統合符号化よりも劣ることが示された。
  • BERT-Clsモデルは、BERTに内蔵された自己注意機構のおかげで、訳文と候補詩行との間の強い相互作用を実現している。
  • データセットは全27,218件のサンプルから構成され、学習用21,778件、検証用2,720件、テスト用2,720件に分割されており、5-言と7-言の詩行に均等に分布している。
  • 再順序付けにBERT埋め込み類似度とLCSの両方を用いることで、ネガティブ候補の質が向上し、照合タスクの難易度が向上した。
  • 本データセットはhttps://github.com/THUNLP-AIPoet/CCPMにて公開されており、中国古典詩の意味理解および生成分野における今後の研究を支援する。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。