[論文レビュー] Ashaar: Automatic Analysis and Generation of Arabic Poetry Using Deep Learning Approaches
本論文は、4つの公開データセットと5つの事前学習モデルを活用して、形式的分類、元音記号の付与、アラブ的スタイル予測、テーマ条件付き詩の生成といったタスクを実行する、アラビア語詩の自動分析および条件付き生成を目的とした深層学習フレームワーク、Ashaarを紹介する。このシステムは強力な性能を示しており、生成された詩における形式分類のトップ5正答率が71.13%に達し、ゼロショット評価での元音記号の誤差率が50.28%にとどまるなど、アラビア語の詩的構造に対する強固な生成および分析能力を示している。
Poetry holds immense significance within the cultural and traditional fabric of any nation. It serves as a vehicle for poets to articulate their emotions, preserve customs, and convey the essence of their culture. Arabic poetry is no exception, having played a cherished role in the heritage of the Arabic community throughout history and maintaining its relevance in the present era. Typically, comprehending Arabic poetry necessitates the expertise of a linguist who can analyze its content and assess its quality. This paper presents the introduction of a framework called extit{Ashaar} https://github.com/ARBML/Ashaar, which encompasses a collection of datasets and pre-trained models designed specifically for the analysis and generation of Arabic poetry. The pipeline established within our proposed approach encompasses various aspects of poetry, such as meter, theme, and era classification. It also incorporates automatic poetry diacritization, enabling more intricate analyses like automated extraction of the extit{Arudi} style. Additionally, we explore the feasibility of generating conditional poetry through the pre-training of a character-based GPT model. Furthermore, as part of this endeavor, we provide four datasets: one for poetry generation, another for diacritization, and two for Arudi-style prediction. These datasets aim to facilitate research and development in the field of Arabic poetry by enabling researchers and enthusiasts to delve into the nuances of this rich literary tradition.
研究の動機と目的
- 深層学習を用いたアラビア語詩の分析および生成のための標準化されたツールやデータセットの不足に対処すること。
- 専用モデルを用いて形式、テーマ、時代、アラビア的構造といった詩的要素の自動分析を可能にすること。
- 微調整された文字ベースのGPTモデルを用いて、形式、韻(カフィーヤ)およびテーマに条件づけた詩の生成を促進すること。
- 今後のアラビア語計算言語学研究を支援するため、形式、元音記号、アラビア的表現、ターフィラートに関するオープンアクセスで高品質なデータセットを提供すること。
- 生成および分析性能をゼロショットおよびフェイシングショット設定で評価し、特に元音記号の付与とリズムの保持に関する性能を評価すること。
提案手法
- フレームワークは、トランスフォーマーに基づくモデルと文字レベルモデルを統合したパイプラインを採用し、形式分類、元音記号の付与、アラビア的スタイル予測を実行する。
- 指定された形式、韻(カフィーヤ)、およびテーマに条件づけた条件付き詩の生成のため、文字ベースのGPTモデルを微調整する。
- 4つの公開データセットを収集した:Ashaar(形式、テーマ、時代のラベル付き)、Ashaar diacritized(クリーニング済みで元音記号が付与された詩)、Ashaar arudi(ゴールドとしてのアラビア的表現)、Ashaar tafeelah(各形式の完全なターフィラート)。
- 微調整なしで、サンプリング戦略を用いてWERおよびDER指標を評価するゼロショット設定で、元音記号の付与モデルを評価する。
- 生成された詩の形式分類は、1,500首の生成詩に対して多数決を用いて評価され、トップn正答率はn=1, 3, 5で測定される。
- 文字レベルのトークナイザーを用いて、形態的および元音記号の詳細を保持するように最適化された10層の変更版GPT-2アーキテクチャを採用する。

実験結果
リサーチクエスチョン
- RQ1深層学習フレームワークは、形式、テーマ、時代を含むアラビア語詩的構造の分析を効果的に自動化できるか?
- RQ2事前学習済みの文字ベースのGPTモデルは、形式、韻、テーマに条件づけた場合に、一貫性がありリズム的に正確な詩をどれほど生成できるか?
- RQ3微調整なしで、未学習のアラビア語詩のテキストに対してゼロショットの元音記号の付与モデルはどの程度の性能を示すか?
- RQ4詩の句からアラビア的スタイル構造を予測する際、このシステムの性能はいかがなものか?
- RQ5生成された詩におけるリズム評価および形式分類に関して、このフレームワークは最先端の手法と比較してどの程度の性能を示すか?
主な発見
- 生成された詩における形式分類のトップ5正答率は71.13%に達し、モデルサイズが小さいにもかかわらず、先行研究を上回る性能を示した。
- サンプリング確率が7のとき、ゼロショットの元音記号の誤差率(DER)は50.28%にとどまり、微調整なしで中程度ながらも有望な性能を示した。
- 微調整なしのゼロショット元音記号の付与において、WERとDERがそれぞれ92%以下および50%以下に保たれ、強力な性能を示した。
- 生成された詩における形式分類の混同行列は、より人気のある形式がより高い正確性で予測されていることを示しており、50%以上の形式で90%以上の信頼度が達成されている。
- リズム評価のトップ1正答率は64.40%に達し、先行のBPEトークナイズドモデルの56.70%を上回った。これは、リズム構造のエンコードがより優れていることを示している。
- 収集済みデータセット(Ashaar, Ashaar diacritized, Ashaar arudi, Ashaar tafeelah)は公開されており、再現性および今後のアラビア語詩的NLP分野の研究を可能にしている。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。