QUICK REVIEW
[論文レビュー] Discourse-Aware Neural Rewards for Coherent Text Generation
Antoine Bosselut, Aslı Çelikyılmaz|arXiv (Cornell University)|May 10, 2018
Topic Modeling参考文献 34被引用数 7
ひとこと要約
本稿では、強化学習を用いて長文生成の整合性を向上させるために、絶対順序型と相対順序型の2種類のニューラル教師を用いた議論に配慮したニューラル報酬を提案する。レシピにおける文の順序付けパターンを教師がスコア化することで、交差エントロピー法や標準的な強化学習ベースラインと比較して、より整合的で反復的でないテキストを生成する。
ABSTRACT
In this paper, we investigate the use of discourse-aware rewards with reinforcement learning to guide a model to generate long, coherent text. In particular, we propose to learn neural rewards to model cross-sentence ordering as a means to approximate desired discourse structure. Empirical results demonstrate that a generator trained with the learned reward produces more coherent and less repetitive text than models trained with cross-entropy or with reinforcement learning with commonly used scores as rewards.
研究の動機と目的
- 高次のn-gram一致スコアを示しても、長文生成において整合性を欠くテキスト生成モデルのギャップを埋める。
- BLEU や ROUGE といった自動指標の限界を克服する。これらの指標は局所的パターンに注目しており、議論的構造を適切に反映していない。
- 人為的アノテーションによる報酬を用いずに、生成器がグローバルな議論的構造を学習できる手法を開発する。
- レシピに見られるスクリプト的時間的パターンを暗黙的に学習するニューラル教師を用いることで、テキスト生成の質を向上させる。
- 相対順序スコアに基づく文単位の報酬配分により、方策学習における責任帰属を改善する。
提案手法
- 文の順序付けパターンをスコア化する絶対順序教師を訓練する。GRUベースのエンコーダとbag-of-words文埋め込みを用い、順方向と逆方向の文シーケンス間の類似度を最小化する。
- 長距離の整合性を捉えるために、長さ3〜6の部分シーケンスを順方向と逆方向で比較する相対順序教師を訓練する。
- 両教師の出力を、生成器における自己誘導的強化学習フレームワークの密度報酬として使用する。
- 報酬の悪用を防ぐために、生成シーケンスを順方向と逆方向の正解シーケンスの両者と比較する二段階報酬メカニズムを設計する。
- 最大尤度推定(MLE)と方策勾配学習を組み合わせた混合訓練目的を実装し、安定性と最適化のバランスを調整するための係数γを用いる。
- 相対順序スコアに基づき、文単位の報酬を配分することで、責任帰属とモデル学習効率を向上させる。
実験結果
リサーチクエスチョン
- RQ1文の順序付けパターンをモデル化するニューラル報酬は、n-gramベースの指標を上回る長文の整合性を向上させることができるか?
- RQ2BLEU や ROUGE といった標準的な自動指標と比較して、教師なしで議論に配慮したニューラル教師を用いる強化学習は、どのように性能を発揮するか?
- RQ3報酬関数に順方向および逆方向のシーケンス比較を組み込むことで、報酬の悪用が抑制され、耐性が向上するか?
- RQ4ハイパーパrameterであるℓ_max や γ が、方策最適化された生成器の性能に与える影響はどの程度か?
- RQ5学習されたニューラル教師は、材料準備、調理手順、提供といったスクリプト的時間的構造を暗黙的に捉えることができるか?
主な発見
- 議論に配慮したニューラル報酬を用いて訓練された生成器は、交差エントロピー法や標準的な強化学習で訓練されたモデルと比較して、著しく整合性の高いテキストを生成した。
- 人的評価により、提案手法による主な改善は表面的な流暢さではなく、より長いシーケンスにおける意味的整合性であると確認された。
- ℓ_max = 6 の相対順序教師が、グローバルな整合性指標で最良の性能を示し、より長い範囲の文脈モデリングが整合性を向上させることを示した。
- γ = 0.97 が、MLEの安定性と方策学習の効果性の両立において最良のバランスを示した。γが低すぎると過小適合が生じ、高すぎると言語モデルの性能が低下した。
- 順方向および逆方向の両方のシーケンスとの比較により、報酬の悪用が抑制された。特に「Serve.」 や 「Here’s direction.」 といった単純なシーケンスで顕著に改善が見られた。
- 議論的構造を測る自動指標において、本手法は強力なベースラインを上回り、人的な整合性評価と整合的であることを示した。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。