Skip to main content
QUICK REVIEW

[論文レビュー] A fine-grained comparison of pragmatic language understanding in humans and language models

Jennifer J. Hu, Sammy Floyd|arXiv (Cornell University)|Dec 13, 2022
Topic Modeling被引用数 4
ひとこと要約

本研究は、専門家が選別した英語の資料を用い、ゼロショットプロンプティングによって、人間と言語モデル(LM)の7つの実用的言語現象に関する微細な比較を実施する。Flan-T5(XL)やtext-davinci-002といった大規模モデルは、高い正確性を達成し、人間の誤りパターンを模倣する——ヒューリスティックに基づく干渉要因よりも、意味的解釈を優先する。これは、精神状態の明示的表現がなくても、実用的行動が出現しうることを示唆するが、皮肉、ユーモア、社会的期待の逸脱といった現象ではモデルの性能が著しく低下する。

ABSTRACT

Pragmatics and non-literal language understanding are essential to human communication, and present a long-standing challenge for artificial language models. We perform a fine-grained comparison of language models and humans on seven pragmatic phenomena, using zero-shot prompting on an expert-curated set of English materials. We ask whether models (1) select pragmatic interpretations of speaker utterances, (2) make similar error patterns as humans, and (3) use similar linguistic cues as humans to solve the tasks. We find that the largest models achieve high accuracy and match human error patterns: within incorrect responses, models favor literal interpretations over heuristic-based distractors. We also find preliminary evidence that models and humans are sensitive to similar linguistic cues. Our results suggest that pragmatic behaviors can emerge in models without explicitly constructed representations of mental states. However, models tend to struggle with phenomena relying on social expectation violations.

研究の動機と目的

  • 微調整なしにゼロショットプロンプティングを用いて、大規模言語モデルが話者の発話の実用的解釈を回復できるかどうかを評価すること。
  • 言語モデルが正しくない実用的解釈を選択する際、人間と同様の誤りを犯すかどうかを調査すること。
  • モデルと人間が、実用的曖昧性を解消するために、同じ言語的手がかりに依存しているかどうかを検討すること。
  • 言語モデルに精神状態の明示的表現がなくても、実用的能力が出現するかどうかを探索すること。
  • 社会的規範、期待、皮肉に依存する現象におけるモデルの弱みを特定すること。

提案手法

  • 専門家が選別した72の選択肢付きの質問を含む、多様な実用的現象をカバーするデータセットを用い、ゼロショットプロンプティングによる言語モデルの評価。
  • サイズと学習目的が異なる4種類の異なる言語モデル(GPT-2、T5-Instruct、Flan-T5(XL)、InstructGPT(text-davinci-002))の使用。
  • 専門家が検証済みの刺激を用いて人間の反応データを収集し、誤りパターンと手がかりへの感受性のベースラインを確立。
  • モデルの回答を微細に分析し、選択分布、誤りタイプ(意味的解釈対ヒューリスティックに基づく干渉要因)、人間のパターンとの感受性を比較。
  • 専門研究者が手作業で選別したデータセットを用い、皮肉、間接的要請、スカラー含意といった現象における言語的・実用的妥当性を保証。
  • 統計的指標を用いて、モデルと人間の回答分布を比較し、正解の選択と誤りパターンの類似性を評価。

実験結果

リサーチクエスチョン

  • RQ1言語モデルはゼロショット設定において、話者の発話の意図された実用的解釈を回復できるか?
  • RQ2言語モデルが失敗する際、人間と同様のタイプの誤り——特にヒューリスティックに基づく干渉要因よりも意味的解釈を優先する——を犯すか?
  • RQ3実用的曖昧性を解消する際、言語モデルと人間は同じ言語的手がかりに感受性を示すか?
  • RQ4言語モデルに精神状態の明示的表現がなくても、実用的行動が出現できるか?
  • RQ5社会的期待の逸脱に依存する実用的現象、たとえば皮肉やユーモアにおいて、モデルのパフォーマンスはいかがなっているか?

主な発見

  • 特にFlan-T5(XL)とOpenAIのtext-davinci-002といった大規模モデルは、実用的理解タスクで高い正確性を示し、人間と同等の性能に近づいている。
  • 誤りが生じた際、モデルはヒューリスティックに基づく干渉要因よりも意味的解釈を優先する傾向が強く、人間参加者で観察された誤りパターンを模倣している。
  • モデルと人間が実用的曖昧性を解消する際に、同様の言語的手がかりに感受性を示しているという、初期的証拠がある。
  • モデルは、皮肉、ユーモア、会話の法則に依存する現象において特に困難を示している。
  • 結果から、精神状態の明示的表現や信念の更新がなくても、言語モデルに実用的能力が出現しうることが示唆される。
  • 高い正確性にもかかわらず、モデルは実際の展開では予測不可能であり、特にtext-davinci-002のようなAPIベースのモデルでは、トレーニングプロトコルの透明性が限られているため、そのリスクが高まっている。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。