Skip to main content
QUICK REVIEW

[論文レビュー] A taxonomy and review of generalization research in NLP

Dieuwke Hupkes, Mario Giulianelli|arXiv (Cornell University)|Oct 6, 2022
Natural Language Processing Techniques参考文献 629被引用数 41
ひとこと要約

本論文は、NLP分野における一般化研究を体系化するための包括的な五軸分類法を導入し、400篇以上の論文と600件以上の実験を分析した。主な動機、一般化の種類、データシフト、シフトの原因、モデリングパイプライン内の位置(locus)を特定し、現在の評価手法における重要なギャップを明らかにするとともに、NLP研究における標準的で頑健な一般化テストを新たな基準とするべきだと提言している。

ABSTRACT

The ability to generalise well is one of the primary desiderata of natural language processing (NLP). Yet, what 'good generalisation' entails and how it should be evaluated is not well understood, nor are there any evaluation standards for generalisation. In this paper, we lay the groundwork to address both of these issues. We present a taxonomy for characterising and understanding generalisation research in NLP. Our taxonomy is based on an extensive literature review of generalisation research, and contains five axes along which studies can differ: their main motivation, the type of generalisation they investigate, the type of data shift they consider, the source of this data shift, and the locus of the shift within the modelling pipeline. We use our taxonomy to classify over 400 papers that test generalisation, for a total of more than 600 individual experiments. Considering the results of this review, we present an in-depth analysis that maps out the current state of generalisation research in NLP, and we make recommendations for which areas might deserve attention in the future. Along with this paper, we release a webpage where the results of our review can be dynamically explored, and which we intend to update as new NLP generalisation studies are published. With this work, we aim to take steps towards making state-of-the-art generalisation testing the new status quo in NLP.

研究の動機と目的

  • NLPモデルにおける一般化の評価において、合意形成と標準化が不足している問題に対処すること。
  • 耐性、公平性、認知的に妥当なモデル動作といった多様な一般化研究の動機を特定・分類すること。
  • 一般化の種類、データシフトおよびその原因、モデリングパイプライン内での位置を網羅的に捉える体系的分類法を構築すること。
  • 提案された分類法を用いて400篇以上の論文と600件以上の実験を分類することで、一般化研究の現状を分析すること。
  • 今後の研究方向性を提言し、体系的で標準化された一般化評価をNLP研究の新たな基準とするよう促進すること。

提案手法

  • 著者らは、一般化研究を特徴付ける五軸分類法を開発した:(1) 動機、(2) 一般化の種類、(3) データシフトの種類、(4) シフトの原因、(5) モデリングパイプライン内でのシフトの位置(locus)。
  • この分類法を用いて、文献から抽出された400篇以上のNLP論文と600件以上の個別の実験を体系的に分類した。
  • 分類は、複数のNLP分野および評価パラダイムを網羅する包括的な文献レビューに基づいて行われた。
  • データのパターンを分析することで、i.i.d.分割への過剰依存や、構成的・構造的一般化の不足といった研究の偏りを同定した。
  • 分類法と結果を視覚化・探索可能な、インタラクティブで動的に更新可能なWebプラットフォームを公開し、継続的な研究の整理支援を可能にした。
  • 質的分類と研究トレンドの定量的分析を統合することで、今後の評価基準の策定を支援する手法を採用した。

実験結果

リサーチクエスチョン

  • RQ1NLP分野における一般化研究を駆り立てる主な動機は何か? それらは評価設計にどのように影響を与えているか?
  • RQ2構成的、構造的、多言語的といった一般化の種類の中で、どれが最もよく研究されており、どの分野がまだ未開拓のままであるか?
  • RQ3NLP一般化研究におけるデータシフトは、原因(自然発生的 vs. 生成済み)と種類(共変量シフト、ラベルシフト、完全シフト)の観点からどのように異なるか?
  • RQ4モデリングパイプラインのどの段階—事前学習、学習、テスト—でデータシフトが最も多く発生しており、それがモデル評価にどのように影響しているか?
  • RQ5人間らしく頑健なモデル行動に不可欠であるにもかかわらず、現在の研究で十分に検討されていない一般化能力は何か?

主な発見

  • 60%以上の一般化研究が、ドメインやスタイルの変更といった単純なデータシフトに焦点を当てており、構成的・構造的一般化は著しく研究が不足している。
  • 構成的一般化を検証する価値がある完全に生成されたデータ分割(例:SCAN)を用いた評価は、全体の12%にとどまり、その価値が十分に活かされていない。
  • 78%の研究が自然なデータ分割または自然に発生するシフトを用いて一般化を評価しているが、これらはしばしば体系的でなく、再現性に欠ける。
  • 研究の焦点に著しい不均衡が見られる:耐性や公平性が主な動機である一方、人間らしい推論を模倣する認知的・内発的動機(例:人間らしさ)は著しく不足している。
  • 標準的なi.i.d.ベンチマーク(例:GLUEスコア>90)では高い性能を示すが、非i.i.i.d.または分布がシフトしたデータでは失敗するため、性能と真の一般化の間には深刻なギャップがある。
  • 分類法の分析から、一般化研究の85%が訓練データからテストデータへのシフトを対象としており、事前学習から学習段階や事前学習からテストへのシフトはわずか10%にとどまっている。これは、継続的学習や生涯学習の能力を評価するうえでの盲点を示している。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。