Skip to main content
QUICK REVIEW

[논문 리뷰] The Turking Test: Can Language Models Understand Instructions?

Avia Efrat, Omer Levy|arXiv (Cornell University)|2020. 10. 22.
Topic Modeling참고 문헌 8인용 수 10
한 줄 요약

이 논문은 대규모 언어 모델이 자연어 지시어를 이해하고 따를 수 있는지 평가하기 위한 벤치마크인 '터킹 테스트(Turking Test)'를 소개한다. 평가 기준이 관대하고 지시어를 반복적으로 개선함에도 불구하고, GPT-2는 nth 단어 검색 작업에서 2%의 정확도를 기록하고 nth 문자 검색에서 1.3%의 정확도를 기록하여, 심지어 간단한 작업조차도 지시어 따르기 능력이 떨어지는 것으로 나타났다.

ABSTRACT

Supervised machine learning provides the learner with a set of input-output examples of the target task. Humans, however, can also learn to perform new tasks from instructions in natural language. Can machines learn to understand instructions as well? We present the Turking Test, which examines a model's ability to follow natural language instructions of varying complexity. These range from simple tasks, like retrieving the nth word of a sentence, to ones that require creativity, such as generating examples for SNLI and SQuAD in place of human intelligence workers ("turkers"). Despite our lenient evaluation methodology, we observe that a large pretrained language model performs poorly across all tasks. Analyzing the model's error patterns reveals that the model tends to ignore explicit instructions and often generates outputs that cannot be construed as an attempt to solve the task. While it is not yet clear whether instruction understanding can be captured by traditional language models, the sheer expressivity of instruction understanding makes it an appealing alternative to the rising few-shot inference paradigm.

연구 동기 및 목표

  • 대규모 언어 모델이 입력-출력 예시에만 의존하는 것이 아니라, 자연어 지시어를 이해하고 따를 수 있는지 조사하는 것.
  • NLP에서 소수의 예시를 통한 프롬프팅 대안으로 지시어 기반 학습의 가능성을 평가하는 것.
  • 지시어에 명시된 제약 조건과 조건을 언어 모델이 얼마나 잘 해석하는지에 대한 내구성을 평가하는 것.
  • 지시어 이해가 소수의 예시 학습보다 더 표현력 있고 일반화 가능한 접근 방식이 될 수 있는지 탐색하는 것.
  • 명확하고 구조화된 지시어에 직면했을 때 모델의 행동에서 나타나는 실패 패턴을 특정하는 것.

제안 방법

  • 세 가지 작업 유형(데이터셋 애너테이션(SNLI, SQuAD, NewsQA), 조건부 명사 목록 작성, 인덱스 기반 요소 검색)을 테스트하는 지시어 따르기 벤치마크인 '터킹 테스트'를 제안한다.
  • 모든 실험에서 Hugging Face의 구현을 통해 GPT-2(1.5B 파라미터)를 사용하며, 그리디 디코딩과 뉴클레오스 샘플링(p=0.9)을 모두 적용한다.
  • 사람의 피드백을 활용한 반복적 지시어 개선을 통해 명확성과 성능을 최적화하고, 사후적으로 가장 높은 성능을 보인 지시어 버전을 선택한다.
  • 간단한 작업은 자동 검증을, 복잡한 작업은 수동 인간 평가를 포함하는 관대한 평가 전략을 적용한다.
  • 생성 시 최대 |x|+20 토큰을 사용하며, EOS 토큰에서 조기 종료를 적용하고, 뉴클레오스 샘플링에서 일관된 성능 저하가 발생함에 따라 그리디 디코딩만 평가한다.
  • GLUE의 진단 데이터셋에서 832개 문장에 대해 평가하며, 단어의 경우 인덱스를 20 이하로, 문자의 경우 40 이하로 제한한다.

실험 결과

연구 질문

  • RQ1GPT-2와 같은 대규모 언어 모델이 복잡도가 증가하는 작업 전반에서 자연어 지시어를 이해하고 정확히 따를 수 있는가?
  • RQ2기초적인 작업에서 지시어 따르기 성능이 가장 흔한 단어나 문자를 생성하는 단순 기준과 비교해 어떻게 다를까?
  • RQ3지시어에 명시된 제약 조건과 조건을 모델이 명백하게 기술된 상태에서도 얼마나 무시하는가?
  • RQ4모델 출력에서 반복 패턴은 지시어를 잘못 이해하거나 해석하지 못했을 때 어떻게 반영되는가?
  • RQ5지시어 기반 접근 방식이 소수의 예시 학습 방식을 엄밀히 일반화한 것으로 볼 수 있으며, 어떤 이점을 제공하는가?

주요 결과

  • GPT-2는 문장에서 nth 단어를 검색하는 작업에서 정확도가 2.0%에 불과하며, 가장 흔한 단어('the')를 생성하는 6.4%의 기준보다도 현저히 낮다.
  • nth 문자 검색 작업에서는 정확도가 1.3%에 그치며, 가장 흔한 문자('e')를 생성하는 13.8%의 기준보다 훨씬 낮다.
  • nth 단어 출력의 46%와 nth 문자 출력의 59%에서 입력 문장이나 지시어가 반복되며, 이는 항상 잘못된 답변을 초래한다.
  • 모델는 지시어 표현 방식에 매우 민감하다: 거의 동일한 지시어를 사용하더라도 단어 작업과 문자 작업 간의 반복 패턴이 상당히 다름을 보인다.
  • 명확한 정답이 하나뿐인 잘 정의된 작업에서는 개방형 작업보다 성능이 열 劣하며, 이는 명시적 제약 조건을 다루는 데에 어려움을 겪고 있음을 시사한다.
  • 반복적인 지시어 개선과 관대한 평가에도 불구하고, 모델는 가장 단순한 지시어조차 이해하지 못하며, 이는 지시어 이해 능력에 근본적인 한계가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.