Skip to main content
QUICK REVIEW

[論文レビュー] Task Ambiguity in Humans and Language Models

Alex Tamkin, Kunal Handa|arXiv (Cornell University)|Dec 20, 2022
Topic Modeling被引用数 8
ひとこと要約

本論文では、人間と言語モデルがタスクの曖昧性をどのように解消するかを研究するための、6つの曖昧に定義された分類タスクからなるベンチマーク「AmbiBench」を紹介する。その結果、人間の性能に匹敵またはそれを上回るのは、人間のフィードバックデータで微調整された大規模言語モデルに限られ、標準的なモデルは少量の文脈内での曖昧な例を微調整することで著しく向上し、曖昧な状況下でも強力な一般化性能を発揮することが可能になることがわかった。

ABSTRACT

Language models have recently achieved strong performance across a wide range of NLP benchmarks. However, unlike benchmarks, real world tasks are often poorly specified, and agents must deduce the user's intended behavior from a combination of context, instructions, and examples. We investigate how both humans and models behave in the face of such task ambiguity by proposing AmbiBench, a new benchmark of six ambiguously-specified classification tasks. We evaluate humans and models on AmbiBench by seeing how well they identify the intended task using 1) instructions with varying degrees of ambiguity, and 2) different numbers of labeled examples. We find that the combination of model scaling (to 175B parameters) and training with human feedback data enables models to approach or exceed the accuracy of human participants across tasks, but that either one alone is not sufficient. In addition, we show how to dramatically improve the accuracy of language models trained without large-scale human feedback training by finetuning on a small number of ambiguous in-context examples, providing a promising direction for teaching models to generalize well in the face of ambiguity.

研究の動機と目的

  • タスク仕様が不明瞭な現実世界の設定において、タスクの曖昧性が人間および言語モデルのパフォーマンスに与える影響を調査すること。
  • 通常のNLPベンチマークが明確に定義されたタスクを特徴としているというギャップを埋めるために、曖昧なタスク定義を対象とするベンチマークを導入すること。
  • 文脈学習および微調整が、曖昧なタスク定義にわたる一般化を支援する有効性を評価すること。
  • 人間のフィードバックで微調整された大規模言語モデルが、指示の明確さや例の数が変化する条件下でも、人間の曖昧性解消性能に匹敵またはそれを上回るかどうかを検討すること。
  • 大規模な人間のフィードバックを必要とせずに、標準言語モデルの曖昧性対処能力を向上させるスケーラブルな手法を提示すること。

提案手法

  • 曖昧な指示と各入力に複数の顕著な言語的特徴を有する6つの分類タスクからなるベンチマーク「AmbiBench」を提案する。
  • 自然言語による指示の明確さ(情報豊富なもの vs. 情報が乏しいもの)の違い、および文脈内でのラベル付き例の数(1から20まで)の変化を考慮した2つの設定で、人間と言語モデルをAmbiBenchで評価する。
  • GPT-3のバリエーション(例:davinci, text-davinci-002)および小規模モデル(例:ada, curie)を含む、さまざまな言語モデルを、異なる指示および例の条件で訓練・評価する。
  • 標準言語モデル(例:davinci)を、少量の曖昧な文脈内例で微調整することで、更解能の向上を図る。
  • 微調整データにおける曖昧性の影響を明確にするために、1つの例セットごとに1つの特徴のみが変化する制御実験を実施する。
  • モデルのパフォーマンスを人間参加者およびベイジアンオラクルと比較し、相対的パフォーマンスおよび一般化能力を評価する。

実験結果

リサーチクエスチョン

  • RQ1自然言語による指示が不明瞭な現実世界に近い設定において、言語モデルと人間は、タスクの曖昧性をどのように解消するか?
  • RQ2モデルサイズのスケーリングや人間のフィードバックデータの使用が、モデルの意図されたタスクの曖昧性解消能力にどの程度寄与するか?
  • RQ3少量の曖昧な文脈内例で標準言語モデルを微調整することで、その曖昧性解消精度を著しく向上させることができるか?
  • RQ4文脈内に複数の曖昧な例が存在する場合、希少または例なしの場合に比べて、より良い一般化が可能になるか?
  • RQ5微調整された標準モデルのパフォーマンスは、未知の曖昧タスクにおいて、人間のフィードバックで微調整された大規模モデルと比べてどうなるか?

主な発見

  • 人間のフィードバックデータで微調整された大規模言語モデル(例:text-davinci-002)は、すべての曖昧タスク条件において、人間参加者と同等またはそれ以上のパフォーマンスを達成する。
  • 人間のフィードバックによる微調整が行われていない標準言語モデル(例:davinci)は、曖昧なタスクにおいて、特に情報が乏しい指示や少ない例の条件下でパフォーマンスが著しく低い。
  • わずか20個の曖昧な文脈内例で標準モデルを微調整することで、顕著なパフォーマンスの向上が得られ、未知の曖昧タスクにおいて人間のフィードバックで微調整されたモデルのパフォーマンスを上回ることすら可能になる。
  • 高いパフォーマンスを達成するには、モデルスケーリングと人間のフィードバックの両方が必要であり、どちらか一方だけでは人間レベルの曖昧性解消能力を達成することはできない。
  • 文脈内例の数が増えるにつれてパフォーマンスは向上するが、最も顕著な向上は、単に例の数を増やすことではなく、曖昧な例で微調整することによるものである。
  • 制御実験により、微調整によるパフォーマンス向上が、多様な文構造へのさらなる露出によるものではなく、曖昧性の解消を学習したためであることが確認された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。