Skip to main content
QUICK REVIEW

[論文レビュー] Deep Reinforcement Learning for Chinese Zero pronoun Resolution

Qingyu Yin, Yu Zhang|arXiv (Cornell University)|Jun 10, 2018
Natural Language Processing Techniques参考文献 26被引用数 12
ひとこと要約

本稿では、中国語のゼロ代名詞解決のための深層強化学習フレームワークを提案する。このフレームワークは、先行詞選択を段階的決定プロセスとしてモデル化し、事前に予測された先行詞を活用することで、長期的な意思決定の正確性を向上させる。ポリシーに基づく強化学習を用いてグローバル性能を最適化することで、OntoNotes 5.0 データセット上で 67.2% の最先端の F スコアを達成し、既存の手法を上回る性能を発揮した。

ABSTRACT

Deep neural network models for Chinese zero pronoun resolution learn semantic information for zero pronoun and candidate antecedents, but tend to be short-sighted---they often make local decisions. They typically predict coreference chains between the zero pronoun and one single candidate antecedent one link at a time, while overlooking their long-term influence on future decisions. Ideally, modeling useful information of preceding potential antecedents is critical when later predicting zero pronoun-candidate antecedent pairs. In this study, we show how to integrate local and global decision-making by exploiting deep reinforcement learning models. With the help of the reinforcement learning agent, our model learns the policy of selecting antecedents in a sequential manner, where useful information provided by earlier predicted antecedents could be utilized for making later coreference decisions. Experimental results on OntoNotes 5.0 dataset show that our technique surpasses the state-of-the-art models.

研究の動機と目的

  • 既存の深層学習モデルが、将来の予測に与える長期的影響を考慮しない短絡的で局所的な意思決定を行うという限界を是正すること。
  • 以前に予測された先行詞からの言語的手がかりを活用することで、グローバルな文脈を統合し、後の共参照意思決定を支援すること。
  • 強化学習を用いてゼロ代名詞解決を段階的決定プロセスとして定式化し、個々のリンク予測ではなく全体の性能最適化を可能にすること。
  • 即時の意思決定と長期的結果のバランスを取るポリシーを学習することで、代名詞のゼロ代名詞解決の正確性を向上させること。

提案手法

  • 与えられたゼロ代名詞のすべての事前に予測された先行詞を1つの代表的ベクトルにエンコードし、これを利用して以降の共参照意思決定をガイドする文脈的情報とする。
  • ポリシーに基づく深層強化学習エージェントを用いて、先行詞を段階的に選択する。ここで行動は、ゼロ代名詞を候補となる語句にリンクすることに対応する。
  • 全体の共参照チェーンの質に基づいたグローバルな報酬信号をエージェントが受信することで、個々のリンクではなく、予測シーケンス全体の最適化が可能になる。
  • ゼロ代名詞と候補となる先行詞をニューラルネットワークでエンコードし、予測済み先行詞の履歴に基づいて隠れ状態を更新する。
  • ポリシーはポリシー勾配法により最適化され、モデルがより高い累積報酬をもたらす意思決定を学習できるようにする。
  • フレームワークは、最終的な共参照チェーン構造にのみ教師信号を用いて、OntoNotes 5.0 データセット上でエンドツーエンドで学習される。

実験結果

リサーチクエスチョン

  • RQ1強化学習エージェントが、先行詞予測間の長期的依存関係をモデル化することで、ゼロ代名詞解決の性能を向上させられるか?
  • RQ2事前に予測された先行詞の情報を活用することで、後の共参照意思決定の正確性にどのような影響を与えるか?
  • RQ3ポリシーに基づく強化学習アプローチは、各ゼロ代名詞に対して独立して局所的な予測を行う標準的な深層学習モデルを上回れるか?
  • RQ4局所的な損失最小化と比較して、グローバルな性能指標を最適化することで、最終的な F スコアはどの程度向上するか?

主な発見

  • 提案された深層強化学習モデルは、OntoNotes 5.0 テストセットで 67.2% の F スコアを達成し、すべての先行する最先端モデルを上回った。
  • 各ゼロ代名詞-候補ペairに対して独立して局所的な意思決定を行うベースラインニューラルネットワークモデルに比べ、本モデルは顕著に優れた性能を示した。
  • 事前に予測された先行詞からの情報を統合することで、特に曖昧なケースにおいて、後の共参照リンクの予測がより正確になった。
  • ポリシーに基づく強化学習アプローチにより、モデルはグローバルな意思決定ポリシーを学習でき、短視眼的な局所的予測による誤りを低減した。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。