Skip to main content
QUICK REVIEW

[논문 리뷰] A fine-grained comparison of pragmatic language understanding in humans and language models

Jennifer J. Hu, Sammy Floyd|arXiv (Cornell University)|2022. 12. 13.
Topic Modeling인용 수 4
한 줄 요약

이 연구는 전문가가 정제한 영어 자료를 사용하여 제로샷 프롬프팅 방식으로 인간과 언어 모델(LM)의 성능을 일곱 가지 담론적 언어 현상에 대해 미세한 수준에서 비교한다. Flan-T5(XL) 및 text-davinci-002와 같은 대규모 모델들은 높은 정확도를 기록하며 인간의 오류 패턴을 반영한다—즉, 히وري스틱 기반의 오답 선택지보다는 문장 그대로의 해석을 선호한다. 이는 정신 상태 표현을 명시적으로 구축하지 않더라도 담론적 행동이 나타날 수 있음을 시사하지만, 모델들은 은유, 유머, 사회적 기대 위반 현상에 대해 어려움을 겪는다.

ABSTRACT

Pragmatics and non-literal language understanding are essential to human communication, and present a long-standing challenge for artificial language models. We perform a fine-grained comparison of language models and humans on seven pragmatic phenomena, using zero-shot prompting on an expert-curated set of English materials. We ask whether models (1) select pragmatic interpretations of speaker utterances, (2) make similar error patterns as humans, and (3) use similar linguistic cues as humans to solve the tasks. We find that the largest models achieve high accuracy and match human error patterns: within incorrect responses, models favor literal interpretations over heuristic-based distractors. We also find preliminary evidence that models and humans are sensitive to similar linguistic cues. Our results suggest that pragmatic behaviors can emerge in models without explicitly constructed representations of mental states. However, models tend to struggle with phenomena relying on social expectation violations.

연구 동기 및 목표

  • 제로샷 프롬프팅을 사용하여 피팅 튜닝 없이도 대규모 언어 모델이 말의 담론적 해석을 복원할 수 있는지 평가하기.
  • 언어 모델이 정확한 담론적 해석을 선택하지 못할 경우 인간과 유사한 오류를 범하는지 조사하기.
  • 모델과 인간이 담론적 모호성을 해결할 때 유사한 언어적 신호에 의존하는지 검토하기.
  • 언어 모델에서 정신 상태의 명시적 표현 없이도 담론적 능력이 어떻게 나타나는지 탐색하기.
  • 사회적 규범, 기대, 은유 등에 기반한 현상에서 모델의 약점을 특정하기.

제안 방법

  • 다양한 담론적 현상을 포함한 72道의 다중선택형 질문으로 구성된 정제된 데이터셋을 사용하여 언어 모델의 성능을 제로샷 프롬프팅 방식으로 평가하기.
  • 크기와 훈련 목적이 다른 네 가지 언어 모델(GPT-2, T5-Instruct, Flan-T5(XL), InstructGPT(text-davinci-002))를 활용하여 다양한 성능을 비교하기.
  • 전문가가 검증한 자극 자료를 기반으로 인간의 응답 데이터를 수집하여 기준 오류 패턴과 신호 민감도를 확립하기.
  • 모델 응답의 미세한 분석을 통해 선택 분포, 오류 유형(Literal vs. 히وري스틱 기반), 인간 패턴과의 민감도 비교 수행하기.
  • 전문 연구자들이 수작업으로 정제한 데이터셋을 사용하여 은유, 간접적 요청, 스칼라 함의 등 다양한 현상에서 언어적 및 담론적 타당성을 확보하기.
  • 통계적 측정을 활용하여 모델과 인간의 응답 분포를 비교하고, 정확한 응답과 오류 패턴의 유사성 평가하기.

실험 결과

연구 질문

  • RQ1언어 모델은 제로샷 환경에서 화자의 말에 대한 의도된 담론적 해석을 회복할 수 있는가?
  • RQ2언어 모델이 실패할 경우, 인간과 동일한 유형의 오류를 범하는가—특히 히وري스틱 기반 오답 선택지보다 문장 그대로의 해석을 선호하는가?
  • RQ3담론적 모호성을 해결할 때 언어 모델과 인간은 동일한 언어적 신호에 민감한가?
  • RQ4언어 모델에서 정신 상태의 명시적 표현 없이도 담론적 행동이 나타날 수 있는가?
  • RQ5사회적 기대 위반에 기반한 현상, 예를 들어 은유나 유머와 같은 담론적 현상에서 모델의 성능은 어떠한가?

주요 결과

  • 특히 Flan-T5(XL)와 OpenAI의 text-davinci-002와 같은 최대 규모의 모델들이 담론적 이해 과제에서 높은 정확도를 기록하며 인간 수준에 가까운 성능을 보였다.
  • 오답 선택 시, 모델들은 히وري스틱 기반 오답 선택지보다 문장 그대로의 해석을 대부분 선택하며 인간 참가자에서 관찰된 오류 패턴을 그대로 반영한다.
  • 모델과 인간이 담론적 모호성을 해결할 때 유사한 언어적 신호에 민감하다는 초기적 증거가 있다.
  • 모델은 은유, 유머, 대화의 원칙 위반과 같은 사회적 기대 위반 현상에서 특히 어려움을 겪는다.
  • 결과적으로, 정신 상태의 명시적 표현이나 믿음 갱신 없이도 언어 모델에서 담론적 능력이 나타날 수 있음을 시사한다.
  • 높은 정확도에도 불구하고, 특히 text-davinci-002와 같은 API 기반 모델의 경우 훈련 프로토콜의 투명도가 낮아 실세계 적용에서 예측 불가능성이 높다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.