Skip to main content
QUICK REVIEW

[論文レビュー] Distributed NLI: Learning to Predict Human Opinion Distributions for Language Reasoning

Xiang Zhou, Yixin Nie|arXiv (Cornell University)|Apr 18, 2021
Topic Modeling被引用数 4
ひとこと要約

本論文では、自然言語推論における人間の判断の分布を予測することを目的とした新しいNLUタスク、Distributed NLIを紹介する。これは、単一ラベル分類から脱却し、人間の判断の分散を予測することを目指している。MC Dropout、Deep Ensemble、Re-Calibration、Distribution Distillationといった分布推定手法を適用することで、モデルはソフトマックスベースラインを著しく上回る性能を示した。特にRe-Calibrationは追加の分布アノテーションを用いることで最良の結果を達成したが、依然として人間の上限性能には大きく及ばない結果にとどまっている。

ABSTRACT

We introduce distributed NLI, a new NLU task with a goal to predict the distribution of human judgements for natural language inference. We show that by applying additional distribution estimation methods, namely, Monte Carlo (MC) Dropout, Deep Ensemble, Re-Calibration, and Distribution Distillation, models can capture human judgement distribution more effectively than the softmax baseline. We show that MC Dropout is able to achieve decent performance without any distribution annotations while Re-Calibration can give further improvements with extra distribution annotations, suggesting the value of multiple annotations for one example in modeling the distribution of human judgements. Despite these improvements, the best results are still far below the estimated human upper-bound, indicating that predicting the distribution of human judgements is still an open, challenging problem with a large room for improvements. We showcase the common errors for MC Dropout and Re-Calibration. Finally, we give guidelines on the usage of these methods with different levels of data availability and encourage future work on modeling the human opinion distribution for language reasoning. Our code and data are publicly available at https://github.com/easonnie/ChaosNLI

研究の動機と目的

  • 自然言語推論における人間の判断の全分布を予測するという観点から、単一ラベルではなく、分布予測を目的とした新しいNLUタスク「Distributed NLI」を形式化・定義すること。
  • 既存の深層学習手法が、NLIタスクにおける人間アノテーションの不確実性とばらつきを効果的にモデル化できるかを調査すること。
  • 追加の分布アノテーションが、人間の判断分布の予測性能に与える影響を評価し、低データまたはドメイン外設定における分布に配慮したモデリングの可能性を検討すること。
  • データの可用性やアノテーションリソースに応じて、分布推定手法の選定ガイドラインを提供すること。
  • 現在の手法の限界を強調し、言語推論タスクにおける人間の意見分布のモデリングに関する今後の研究を促すこと。

提案手法

  • 標準的なNLIタスクを、3つのラベル(entailment, neutral, contradiction)の確率分布を予測するように変更し、単一ラベルの予測から逸脱する。
  • 予測不確実性の推定と分布のキャリブレーション向上を目的として、4つの分布推定手法(モンテカルロドロップアウト(MC Dropout)、ディープアンサンブル、Re-Calibration、ディストリビューションディスティルレーション)を適用する。
  • MC Dropoutでは、テスト時におけるドロップアウトを適用し、複数回の順方向伝搬を実行して予測分散を推定し、予測の分布を形成する。
  • Re-Calibrationでは、分布アノテーションで訓練された温度スケーリング法を用いて、モデルのロジットを再重み付けすることで、信頼度のキャリブレーションを向上させる。
  • 人間のアノテーション分布から導出されたソフトラベルを用いた交差エントロピー損失でモデルを訓練することで、知識蒸留が可能となり、一般化性能が向上する。
  • KLDやBrierスコアといった指標を用いて、予測分布と人間アノテートされた分布を比較し、ドメイン内およびドメイン外のテストセットで手法を評価する。

実験結果

リサーチクエスチョン

  • RQ1単一ラベルNLIデータで学習した深層学習モデルは、NLI例における人間の判断の全分布を効果的に予測できるか?
  • RQ2MC Dropout、Deep Ensemble、Re-Calibration、Distribution Distillationといった異なる分布推定手法は、人間の意見分布をどの程度正しく捉えられるか?
  • RQ3追加の分布アノテーションは、人間の判断分布の予測性能をどの程度向上させるか?
  • RQ4これらの手法は、ドメイン内ファインチューニングなしでドメイン外テストセットにもどの程度一般化できるか?
  • RQ5MC DropoutとRe-Calibrationの分布予測における一般的な失敗モードや限界は何か?

主な発見

  • MC Dropout、Deep Ensemble、Re-Calibration、Distribution Distillationという4つの分布推定手法は、いずれも標準的なソフトマックスベースラインを著しく上回る性能を示した。
  • MC Dropoutは、分布アノテーションを一切必要とせず、不確実性推定のための即時適用可能な手法としての有効性を示した。
  • Re-Calibrationは追加の分布アノテーションが提供された場合、他のテスト手法と比較して最も優れた性能を達成した。
  • 改善が見られたが、最も性能の良いモデル(Re-Calibration)でも、推定された人間の上限性能には著しく及ばない結果であり、このタスクが依然として挑戦的であることが示された。
  • MC DropoutとRe-Calibrationは、ドメイン内学習データなしでドメイン外テストセットに対してもある程度の一般化を示しており、ドメインをまたいで安定した性能を発揮していることが示された。
  • MC DropoutとRe-Calibrationの一般的な誤りは、中立的予測に対して過信を示し、特に曖昧または実用的・文化的に複雑な例では少数意見のシフトを捉えきれていないことである。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。