Skip to main content
QUICK REVIEW

[論文レビュー] proScript: Partially Ordered Scripts Generation via Pre-trained Language Models

Keisuke Sakaguchi, Chandra Bhagavatula|arXiv (Cornell University)|Apr 16, 2021
Topic Modeling参考文献 33被引用数 8
ひとこと要約

本稿では、日常的な状況を想定した部分的に順序付けられたスクリプトのための大規模(6.4k)でクラウドソーシングされたデータセットであるproScriptを紹介し、微調整された事前学習済み言語モデルを用いた、2つの新しいタスク(エッジ予測と完全スクリプト生成)を提案する。モデルは強力な性能(エッジ予測のF1=75.7)を達成しており、生成モデルが構造的で部分的に順序付けられたスクリプトを効果的に生成できることを初めて示したが、人間の水準の正確性に比べて依然として顕著な性能格差が存在する。

ABSTRACT

Scripts - standardized event sequences describing typical everyday activities - have been shown to help understand narratives by providing expectations, resolving ambiguity, and filling in unstated information. However, to date they have proved hard to author or extract from text. In this work, we demonstrate for the first time that pre-trained neural language models (LMs) can be be finetuned to generate high-quality scripts, at varying levels of granularity, for a wide range of everyday scenarios (e.g., bake a cake). To do this, we collected a large (6.4k), crowdsourced partially ordered scripts (named proScript), which is substantially larger than prior datasets, and developed models that generate scripts with combining language generation and structure prediction. We define two complementary tasks: (i) edge prediction: given a scenario and unordered events, organize the events into a valid (possibly partial-order) script, and (ii) script generation: given only a scenario, generate events and organize them into a (possibly partial-order) script. Our experiments show that our models perform well (e.g., F1=75.7 in task (i)), illustrating a new approach to overcoming previous barriers to script collection. We also show that there is still significant room for improvement toward human level performance. Together, our tasks, dataset, and models offer a new research direction for learning script knowledge.

研究の動機と目的

  • 日常的な状況のための高品質で構造的な常識的スクリプトの収集と生成という長年の課題に取り組むこと。
  • 多様な粒度と時間的期間を捉えた、部分的に順序付けられたスクリプトの大型でクラウドソーシングされたデータセット(proScript)を構築すること。
  • 2つの補完的タスクを導入する:(i) エッジ予測(順序のないイベントの順序付け)、(ii) 完全スクリプト生成(シナリオからイベントとその部分的順序を生成)。
  • 事前学習済み言語モデルがスクリプト生成に効果的に微調整可能であることを示し、スクリプト収集とモデリングのこれまでの障壁を克服すること。
  • 物語の穴埋めタスクを超えた、完全なスクリプト構造と品質に焦点を当てた、スクリプト知識評価のための新しいベンチマークを確立すること。

提案手法

  • 簡素化された手法を用いて6.4kの部分的に順序付けられたスクリプトをクラウドソーシングし、イベントの粒度、時間的期間、および修正タイプのアノテーションを付与する。
  • 2つのタスクを定義する:(i) エッジ予測—シナリオと順序のないイベントが与えられたとき、有効な部分的順序スクリプトを予測する。 (ii) スクリプト生成—シナリオのみからイベントとその部分的順序を生成する。
  • T5 や BART などの事前学習済み言語モデルを、両タスクに微調整し、系列生成とグラフ構造予測を統合する。
  • モデル出力を人間アノテート済みスクリプトと比較するために、グラフ編集距離と人間による修正分析を用いる。
  • WikiHow と proScript_gen を用いて、トランスファー学習およびパイプラインベースラインを実装し、性能を比較する。
  • 誤差分析のため、人間による評価を実施し、修正タイプ(例:順序の誤り、欠落したイベント、言い換えられたイベント)を分類する。

実験結果

リサーチクエスチョン

  • RQ1事前学習済み言語モデルは、日常的な状況のための高品質で部分的に順序付けられたスクリプトを効果的に微調整可能か?
  • RQ2構造的正確性と一貫性の観点から、モデルが生成したスクリプトの性能は、人間が作成したスクリプトと比べてどの程度か?
  • RQ3エッジ予測と完全スクリプト生成の2つのタスクは、スクリプト知識のどの側面を別々に捉えているのか?
  • RQ4モデルが生成するスクリプトで最も一般的な誤りタイプは何か?また、それらは人間の修正パターンと比べてどう異なるか?
  • RQ5トランスファー学習やパイプラインアプローチは、proScript での直接微調整を上回る性能向上をもたらすか?

主な発見

  • proScript データセットには、6,400件のクラウドソーシング済みで部分的に順序付けられたスクリプトが含まれており、多様な粒度と時間的期間のアノテーションが付与されており、以前のデータセットよりも顕著に大きい。
  • 最良のモデルはエッジ予測タスクでF1スコア75.71を達成し、ベースラインを上回ったが、人間の性能(89.28)にはまだ及ばない。
  • 完全スクリプト生成において、最良のモデルはグラフ編集距離4.97を達成したが、人間が作成したスクリプトの2.98と比べて、依然として大きな改善余地がある。
  • エッジ関連の修正(例:順序の誤り)が最も頻出する誤りタイプであり、現在のモデルが構造的順序付けの課題に直面していることを示唆している。
  • 「誤りのない」修正(例:言い換え、粒度の変更)が、重大な誤り(例:欠落または不適切なイベント)よりも一般的であるため、モデルは妥当ではあるが構造的に欠陥のあるスクリプトを生成していることが示唆される。
  • トランスファー学習およびパイプラインベースラインは、proScript での直接微調整を上回る性能向上をもたらさず、proScript_gen がスクリプト生成の強力なベースラインであることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。