[論文レビュー] Goal-Directed Story Generation: Augmenting Generative Language Models with Reinforcement Learning
本稿では、知識グラフ状態表現と方策ネットワークを用いて、GPT-2ベースの物語生成を特定の目的イベントへ誘導する強化学習フレームワークを提案する。生成と制御を分離することで、自然な流れを保ちながら90%以上の目的到達率を達成し、人間評価において微調整済み言語モデルおよびベースラインを上回る性能を発揮する。
The advent of large pre-trained generative language models has provided a common framework for AI story generation via sampling the model to create sequences that continue the story. However, sampling alone is insufficient for story generation. In particular, it is hard to direct a language model to create stories to reach a specific goal event. We present two automated techniques grounded in deep reinforcement learning and reward shaping to control the plot of computer-generated stories. The first utilizes proximal policy optimization to fine-tune an existing transformer-based language model to generate text continuations but also be goal-seeking. The second extracts a knowledge graph from the unfolding story, which is used by a policy network with graph attention to select a candidate continuation generated by a language model. We report on automated metrics pertaining to how often stories achieve a given goal event as well as human participant rankings of coherence and overall story quality compared to baselines and ablations.
研究の動機と目的
- GPT-2のような大規模事前学習言語モデルが、指定された終状態に到達できないという課題に対処すること。
- 大規模モデルにおける報酬形状化微調整の限界を克服すること。これは、自然な流れが向上する一方で、目的到達率は50%にとどまることを意味する。
- 言語モデルの微調整なしに、抽象的な知識グラフ状態に基づいて方策ネットワークが継続を選択する2段階システムを構築することにより、目的指向行動を可能にすること。
- 自動評価指標と人間参加者による研究を用いて、目的到達率、一貫性、自然さの観点からシステムの性能を評価すること。
- 知識グラフ状態表現が、物語生成における効果的な強化学習に不可欠であることを示すこと。
提案手法
- 物語の内容から動的に知識グラフが構築され、エンティティと関係が<主語, 関係, 宮語>三元組として表現され、物語世界の状態をモデル化する。
- GAT(グラフ自己注意ネットワーク)に基づく方策ネットワークが、GPT-2が出力する候補継続を評価し、目的に近づく可能性に基づいて選択する。報酬信号は、残りの目的到達までのステップ数の逆数に比例する。
- プロキシマルポリシー最適化(PPO)を用いて方策ネットワークを訓練し、目的到達を最適化するとともに、自然な言語の質を維持する。
- DQNベースのエージェントが、GPT-2が生成した候補群から継続を選び、知識グラフを入力として状態の価値を推定する。
- 言語生成と制御を分離する:GPT-2は多様で自然な継続を生成し、方策ネットワークが最も目的に寄与するものを選択する。
- 方策ネットワークに報酬形状化機構を適用し、目的までの推定ステップ数を減らす継続に対して高い報酬を与える。
実験結果
リサーチクエスチョン
- RQ1GPT-2のような大規模事前学習言語モデルに対して、強化学習を用いて特定の目的イベントへ誘導することは、実際に有効に適用可能か?
- RQ2言語モデルの隠れ状態に依存するのではなく、知識グラフを状態表現として用いることで、目的指向物語生成の性能が向上するか?
- RQ3知識グラフに基づく方策ネットワークの性能は、報酬形状化により言語モデルを直接微調整するのと比べてどうか?
- RQ4人間評価において、知識グラフ表現が物語の一貫性と目的到達率にどの程度寄与しているか?
- RQ5言語モデルが候補を生成し、方策がそれらを選択する2段階システムは、エンドツーエンドの微調整に比べて、より高い目的到達率を達成できるか?
主な発見
- KG-DQNモデルは、指定された目的イベントに到達する成功率が90%以上に達し、ベースラインのGPT2-Sci-FiおよびGPT2-RSモデルを著しく上回った。
- 人間参加者は、一貫性、反復回避、妥当性、局所的因果関係のすべての次元において、KG-DQNモデルをベースラインおよびGPT2-RSモデルよりも顕著に好んだ(p < 0.01)。
- 知識グラフを削除したDQNアブレーションでは、性能が著しく低下し、知識グラフが効果的な方策学習を可能にする主要因であることが示された。
- 報酬形状化により微調整されたGPT2-RSモデルは、自然さが向上したものの、目的到達率はわずか50%にとどまり、大規模モデルに対して直接的な微調整は効果が薄いことが示された。
- KG-DQNモデルに報酬形状化を追加したKG-DQN-RSでは、反復回避の性能のみが向上したが、目的到達率や一貫性には影響がなかった。これは、方策ネットワークのグラフベース推論が、言語モデルの微調整よりも重要であることを示唆している。
- DQNベースのモデルが生成した物語は、平均して4〜5イベントで目的に到達するなど、より簡潔であった。一方、GPT2-RSはより長く、幻覚的で、ランダムな登場人物の導入が多い物語を生成した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。