[論文レビュー] Visual Story Generation Based on Emotion and Keywords
本論文は、ユーザー指定のキーワードと感情ラベルを用いて一貫性があり感情的に整合性のある物語を生成するインタラクティブなビジュアルストーリー共同作成パイプラインを提案する。感情予測に微調整されたBERTと、条件付き物語生成にT5を組み合わせ、画像生成には拡散モデルを、物体認識にはYOLOv5/Faster R-CNNを活用することで、反復的なキーワード拡張を実現し、ベースライン手法比で平均62%のBLEUスコア向上を達成した。
Automated visual story generation aims to produce stories with corresponding illustrations that exhibit coherence, progression, and adherence to characters' emotional development. This work proposes a story generation pipeline to co-create visual stories with the users. The pipeline allows the user to control events and emotions on the generated content. The pipeline includes two parts: narrative and image generation. For narrative generation, the system generates the next sentence using user-specified keywords and emotion labels. For image generation, diffusion models are used to create a visually appealing image corresponding to each generated sentence. Further, object recognition is applied to the generated images to allow objects in these images to be mentioned in future story development.
研究の動機と目的
- ユーザーが物語生成における感情的トーンと重要な要素を制御できるインタラクティブなビジュアルストーリー共同作成システムの開発。
- 感情とキーワード制約を統合することで、自動化されたビジュアルストーリーティングにおける物語の整合性と論理的進行の向上。
- 生成された画像からの物体認識を活用して、新たなキーワードを抽出し、反復的な物語開発を可能にする。
- 複数のNLP指標を用いて、感情とキーワードプロンプトの影響が物語生成品質に与える影響を評価する。
- ユーザーが関与するフィードバックループをサポートする、完全なテキストから画像へのパイプラインの構築。
提案手法
- 直前の物語的文脈に基づき、次の物語文の感情ラベルを予測するための微調整済みBERT${}_{\textsc{Next Emo}}$。
- ユーザーが提供したキーワードと感情ラベルを条件として、次の文を生成するための微調整済みT5${}_{\textsc{BASE Fine-tuned CommonGen}}$。
- 各生成された文に対応する画像を生成するために、拡散モデル(例:Disco Diffusion)を採用。
- 生成された画像に対してYOLOv5およびFaster R-CNNを適用し、将来の物語開発のための新たなキーワードを抽出。
- 抽出された物体が、以降の物語ステップでの推奨キーワードとして使用されるフィードバックループを統合。
- 推論時における一貫性のある入力フォーマットを保証するため、固定テンプレートを用いたプロンプト工学を実施。

実験結果
リサーチクエスチョン
- RQ1ユーザー指定の感情とキーワードは、生成された物語の整合性と論理的一貫性を顕著に向上させることができるか?
- RQ2文脈のみに依存するベースラインと比較して、感情とキーワードプロンプトの統合は物語生成品質にどのように影響するか?
- RQ3生成された画像からの物体認識は、反復的かつ進化する物語開発をどの程度支援できるか?
- RQ4プラチキの感情の輪に基づく感情予測モデルは、物語生成の文脈でどの程度の性能を示すか?
- RQ5テキスト、感情、画像、物体認識のマルチモーダルフィードバックは、全体的なビジュアルストーリーティング品質にどのような影響を与えるか?
主な発見
- 提案されたパイプラインは、推論に物語文脈のみに依存するベースラインモデルと比較して、平均62%のBLEUスコア向上を達成した。
- BERTスコアがゼロとなるサンプル数が顕著に減少し、人間が書いた物語とより整合性があることを示した。
- 平均的なBERTスコアは6.7%向上し、生成された物語の意味的品質と整合性が向上したことを示した。
- スコアの変動が低減したため、より安定的かつ信頼性の高い生成性能を示した。
- 生成された画像からの物体認識により、新たなキーワードが効果的に抽出され、反復的かつ進化する物語開発が可能になった。
- 感情予測モデル(BERT${}_{\textsc{Next Emo}}$)はマクロAUC-ROCスコア0.78を達成し、感情に配慮した物語生成における実用性を確認した。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。