[論文レビュー] Targeted Syntactic Evaluation of Language Models
本稿では、言語モデルの的を経て構文的一般化を評価するためのテンプレートベースのデータセットを紹介する。最小限の対比文ペア(文法的で正しい文と不文法的で誤りのある文)を生成し、モデルが正しい形に高い確率を割り当てるかどうかをテストする。CCGスーパークラスタグの多タスク学習による改善にもかかわらず、RNN言語モデルは、目的語の関係節を介した一致といった複雑な構文的依存関係において、依然として人間の性能に大きく劣っている。
We present a dataset for evaluating the grammaticality of the predictions of a language model. We automatically construct a large number of minimally different pairs of English sentences, each consisting of a grammatical and an ungrammatical sentence. The sentence pairs represent different variations of structure-sensitive phenomena: subject-verb agreement, reflexive anaphora and negative polarity items. We expect a language model to assign a higher probability to the grammatical sentence than the ungrammatical one. In an experiment using this data set, an LSTM language model performed poorly on many of the constructions. Multi-task training with a syntactic objective (CCG supertagging) improved the LSTM's accuracy, but a large gap remained between its performance and the accuracy of human participants recruited online. This suggests that there is considerable room for improvement over LSTMs in capturing syntax in a language model.
研究の動機と目的
- 文法的一般化の評価を、自己完結的かつスケーラブルな方法で、パープレキシティを超えて行うための手法を開発すること。
- ニューラル言語モデルが、構造に敏感な現象を含む文法的・不文法的文のペアを正確に区別できるかどうかを調査すること。
- 構文的監視(CCGスーパークラスタグ)を用いた多タスク学習が、構文的性能に与える影響を評価すること。
- 困難な構文的構造において、モデルの性能を人間の性能と比較すること。
- 特に非局所的依存関係において、言語モデルの構文的推論に見られる体系的な誤りを同定すること。
提案手法
- 特定の構文的現象に関して、文法的・不文法的の差異のみを有する最小対比文ペアを、テンプレートを用いて自動生成する。
- 3つの現象について文ペアを構築する:主語・動詞一致、反射代名詞の照応、否定極性語(NPIs)。
- n-gramベースライン、単一言語のコーパス上で学習したRNN言語モデル、および言語モデリングとCCGスーパークラスタグの両タスクを同時に最適化する多タスクRNNを訓練する。
- 各ペアにおいて、文法的文と不文法的文に割り当てられた確率を比較することで、モデルを評価する。
- 同じ刺激を用いて人間の評価を実施し、パフォーマンスのベンチマークを確立する。
- 詳細な誤差分析を用いて、主語・動詞一致における引き寄せ誤り(attraction errors)などのモデルバイアスを同定する。
実験結果
リサーチクエスチョン
- RQ1言語モデルは、構文的整合性の違いのみを有する最小対比文ペアにおいて、文法的文に高い確率を割り当てる能力を信頼的に有しているか?
- RQ2CCGスーパークラスタグを用いた多タスク学習は、RNN言語モデルの構文的一般化能力をどのように向上させるか?
- RQ3言語モデルは、目的語の関係節を介した一致といった非局所的構文的依存関係において、どの程度失敗するか?
- RQ4モデルのパフォーマンスパターンは、同じ構文的タスクにおいて人間のパフォーマンスとどのように比較できるか?
- RQ5言語モデルは、構文的意思決定において、どのような体系的なバイアスやヒューリスティックを示しているか?
主な発見
- n-gramベースラインは偶然レベルの性能を示し、構文的一般化にはn-gram統計を超える能力が必要であることが示された。
- 単一タスクRNNは局所的主語・動詞一致では良好に機能したが、非局所的依存関係では失敗し、目的語の関係節を介した一致では偶然レベルに近い性能にとどまった。
- 多タスクRNNは非局所的依存関係において性能が向上したが、依然として人間参加者に大きく劣っており、特に複雑なケースで顕著であった。
- 両方のRNNは引き寄せ誤りを示し、関係節内の主語(内蔵主語)と一致する動詞を好む傾向にあった。
- 単一タスクRNNは、単数動詞をデフォルトとして好む傾向を示し、これは子供の言語獲得のパターンと類似していた。
- 人間参加者も複数形/複数形の目的語関係節において誤りを犯していたが、全体としてモデルを上回っていた。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。