[論文レビュー] Beyond Narrative Description: Generating Poetry from Images by Multi-Adversarial Training
本稿では、視覚的・比喩的埋め込みを共同で学習し、二重の識別器を用いてクロスモーダルな関連性と比喩的言語スタイルを強制する、画像から詩を生成するためのマルチ敵対的生成モデルを提案する。この手法は、自動評価および人間評価の両方で最先端の性能を達成しており、人間評価者が生成された詩と人間が書いた詩を区別できないというチューリングテストでも高い性能を示した。
Automatic generation of natural language from images has attracted extensive attention. In this paper, we take one step further to investigate generation of poetic language (with multiple lines) to an image for automatic poetry creation. This task involves multiple challenges, including discovering poetic clues from the image (e.g., hope from green), and generating poems to satisfy both relevance to the image and poeticness in language level. To solve the above challenges, we formulate the task of poem generation into two correlated sub-tasks by multi-adversarial training via policy gradient, through which the cross-modal relevance and poetic language style can be ensured. To extract poetic clues from images, we propose to learn a deep coupled visual-poetic embedding, in which the poetic representation from objects, sentiments and scenes in an image can be jointly learned. Two discriminative networks are further introduced to guide the poem generation, including a multi-modal discriminator and a poem-style discriminator. To facilitate the research, we have released two poem datasets by human annotators with two distinct properties: 1) the first human annotated image-to-poem pair dataset (with 8,292 pairs in total), and 2) to-date the largest public English poem corpus dataset (with 92,265 different poems in total). Extensive experiments are conducted with 8K images, among which 1.5K image are randomly picked for evaluation. Both objective and subjective evaluations show the superior performances against the state-of-the-art methods for poem generation from images. Turing test carried out with over 500 human subjects, among which 30 evaluators are poetry experts, demonstrates the effectiveness of our approach.
研究の動機と目的
- 画像から比喩的言語を生成する課題に対処すること。これは、事実的な画像記述をはるかに超えて、抽象的で感情的・象徴的な手がかりを捉える必要がある。
- 視覚的コンテンツと比喩的表現の間のギャップを埋めるために、感情、物体、風景を共有の空間に捉える深層連携視覚的・比喩的埋め込みを学習すること。
- 二重の識別器による敵対的訓練を通じて、画像との関連性と比喩的言語スタイルの両方を強制することで、詩の質を向上させること。
- 画像から詩を生成する分野の研究を促進するために、2つの新しいデータセットを公開すること:MultiM-Poem(8,292組の画像・詩ペア)とUniM-Poem(92,265首の詩)。
提案手法
- 畳み込みニューラルネットワーク(CNN)からの視覚的特徴と、物体、感情、風景といった比喩的表現を統合して共有の埋め込み空間に符号化する深層連携視覚的・比喩的埋め込み(VPE)モデルを提案する。
- マルチモーダル識別器($D_m$)を採用し、実際の画像・詩ペアと生成されたペアを比較することで、生成された詩が入力画像に関連していることを保証する。
- 詩のスタイル識別器($D_p$)を導入し、簡潔さ、想像力のある語選び、テーマの一貫性といった比喩的言語スタイルを強制する。
- ポリシー勾配に基づく強化学習を用いて生成器を最適化し、両方の識別器からの報酬が生成プロセスを導く。
- 検索と生成の手法を統合されたフレームワークで組み合わせることで、生成された詩の質と多様性を向上させる。
- 生成器を敵対的損失に基づいてエンドツーエンドで訓練する。生成器は両方の識別器をだませるように更新され、関連性と比喩的表現の両立が図られる。
実験結果
リサーチクエスチョン
- RQ1視覚的表現を、感情、比喩、象徴といった比喩的概念へ効果的にマッピングする方法は何か?
- RQ2二重の識別器による敵対的訓練は、画像との関連性と比喩的言語の質の両方を向上させることができるか?
- RQ3深層視覚的・比喩的埋め込みモデルは、標準的な画像キャプションにない抽象的な比喩的手がかりを、画像からどれだけ的確に捉えることができるか?
- RQ4人間評価者は、生成された詩の質と真正性を、人間が書いた詩と比較してどのように評価するか?
- RQ5二重識別器を用いるモデルと、単一識別器やベースラインモデルとを比較した場合、自動評価および主観的評価指標にどのような影響を与えるか?
主な発見
- マルチモーダル識別器と詩のスタイル識別器を備えたI2P-GANモデルは、全体の質に関する人間評価で最高得点(7.18/10)を記録し、Show and Tell や SeqGAN などのすべてのベースラインを上回った。
- 生成された詩の関連性、一貫性、創造性の各分野で、人間評価の平均得点が7.18/10に達し、次に優れた手法(6.85/10)を顕著に上回った。
- チューリングテストでは、詩の専門家が画像とともに提示された詩のうち60%を人間が書いたと正しく特定できたが、生成された詩は依然として大きな混乱を引き起こしており、人間とほとんど区別がつかない質の高さを示した。
- 両方の識別器を備えたモデルは、BLEU(6.59)と新規性(7.05)の両方で最高のバランスを達成し、高い関連性と創造性を維持しながらも、一般化性能に優れていることを示した。
- 視覚的・比喩的埋め込み(VPE)モデルは、『明るい日差し』から『希望』を、『空席』から『孤独』を捉えるといった、比喩的手がかりの捉え方において、ベースライン手法よりも優れた性能を示した。
- MultiM-Poem(8,292組のペア)とUniM-Poem(92,265首の詩)の公開により、画像から詩を生成する分野における、初めての大規模かつ公開可能なデータセットが提供された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。