Skip to main content
QUICK REVIEW

[論文レビュー] Combining Learned Lyrical Structures and Vocabulary for Improved Lyric Generation

Pablo Samuel Castro, Maria Attarian|arXiv (Cornell University)|Nov 12, 2018
Topic Modeling参考文献 2被引用数 8
ひとこと要約

本稿では、楽曲構造に配慮した変換器言語モデル(L_S)と、語彙が豊富な書籍ベースのモデル(L_V)を組み合わせたハイブリッドフレームワークを提案する。この手法により、より多様で構造的に整合性があり、創造的に魅力的な楽曲の歌詞生成が可能になる。語彙が豊富なモデルを、既存の歌詞の構造的パターン(品詞タグを用いて)に条件づけることで、反復を著しく低減し、語彙の多様性を向上させ、純粋な歌詞モデルや純粋な書籍モデルを上回る5行の verse を生成する。

ABSTRACT

The use of language models for generating lyrics and poetry has received an increased interest in the last few years. They pose a unique challenge relative to standard natural language problems, as their ultimate purpose is reative, notions of accuracy and reproducibility are secondary to notions of lyricism, structure, and diversity. In this creative setting, traditional quantitative measures for natural language problems, such as BLEU scores, prove inadequate: a high-scoring model may either fail to produce output respecting the desired structure (e.g. song verses), be a terribly boring creative companion, or both. In this work we propose a mechanism for combining two separately trained language models into a framework that is able to produce output respecting the desired song structure, while providing a richness and diversity of vocabulary that renders it more creatively appealing.

研究の動機と目的

  • 既存のニューラル言語モデルが、創造的に豊かで構造的に整合性のある楽曲の歌詞を生成する際の限界を克服すること。
  • AI生成楽曲の歌詞における反復的出力の低減と語彙多様性の向上。
  • 楽曲の構造モデリングと文学テキストからの語彙強化の統合。
  • 楽曲の構造を維持しつつ、創造的訴求力と言語的豊かさを向上させるフレームワークの開発。
  • 人間の介入を伴わない、より自律的で芸術的質の高い楽曲生成の実現。

提案手法

  • 構造に配慮したモデル(L_S)は、歌詞を品詞(PoS)シーケンスに変換したデータで学習させ、語彙に依存しない楽曲の文法構造を学習する。
  • 語彙が豊富なモデル(L_V)は、Project Gutenberg の書籍で学習させ、文脈構造マスキング戦略を採用:入力は文の接頭部、出力はその品詞タグを含む接尾部。
  • 最終的な生成プロセスでは、ビームサーチを用いて次の行を生成する:l₂ = L_V(l₁ · L_S(PoS(l₁)))。文脈と構造を統合する。
  • フレームワークは構造学習と語彙豊かさの分離を実現し、多様性の向上を図った制御生成を可能にする。
  • L_S の学習中に、歌詞に品詞タグを適用し、語彙的コンテンツとは分離された構造的パターンを抽出する。
  • 本手法は、推論時に条件付き生成により、2つの別個の事前学習済み変換器言語モデルを統合する。

実験結果

リサーチクエスチョン

  • RQ1構造に配慮した言語モデルと語彙が豊富な言語モデルを組み合わせることで、生成される歌詞の多様性と創造性が向上するか?
  • RQ2本手法は、純粋な歌詞モデルや純粋な書籍モデルと比較して、行の反復をどれほど低減し、語彙の多様性を向上させるか?
  • RQ3モデルが言語的に豊かで多様な内容を生成しつつ、楽曲の構造をどの程度維持できるか?
  • RQ4ハイブリッドアプローチにより、AI支援楽曲生成における人間の介入の必要性をどれほど低減できるか?
  • RQ5豊富な語彙を持つモデルを、PoSで構造化された歌詞パターンに条件づけることで、より構造的整合性があり芸術的に妥当なverseが生成されるか?

主な発見

  • RichLyrics モデルは、1行あたり平均6.93語を生成し、PureLyrics(12.85)よりはるかに低く、PureBooks(6.63)に近く、行長のバランスが優れていることが示された。
  • RichLyrics は1 verseあたり0.441行の反復にとどまったが、PureLyrics は2.233と著しく高い水準であり、反復の低減が明確に確認された。
  • 連続する行間の繰り返し語の割合は、RichLyrics が0.480、PureLyrics が0.671 であり、語彙多様性の向上が裏付けられた。
  • RichLyrics の平均語長(3.542)は、自然な歌詞の語長に PureBooks(3.758) よりも近く、歌詞に適した言語的適合性を示唆した。
  • 定性的分析により、RichLyrics の出力は PureLyrics や PureBooks と比較して、より多様で創造的に魅力的であることが確認された。
  • フレームワークは、構造学習と語彙強化の分離に成功し、より制御的かつ多様な楽曲生成を可能にした。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。