Skip to main content
QUICK REVIEW

[논문 리뷰] Can language models learn from explanations in context?

Andrew K. Lampinen, Ishita Dasgupta|arXiv (Cornell University)|2022. 04. 05.
Topic Modeling인용 수 15
한 줄 요약

이 논문은 언어 모델(LMs)이 입력-출력 예시와 함께 답변 설명을 통합함으로써 소수의 예시에 기반한 인식 학습을 향상시킬 수 있는지 조사한다. 인간이 애너테이션한 설명과 제어 조건을 포함한 40개의 다양한 어려운 과제를 사용하여, 저자들은 설명—특히 수작업으로 조정된 설명—이 소수의 예시에 기반한 학습에서 성능을 크게 향상시키며, 미세조정 없이도 효과를 보임을 보여주며, 이는 설명이 모델이 과제 원리를 더 효과적으로 유추하는 데 도움이 된다는 것을 시사한다.

ABSTRACT

Language Models (LMs) can perform new tasks by adapting to a few in-context examples. For humans, explanations that connect examples to task principles can improve learning. We therefore investigate whether explanations of few-shot examples can help LMs. We annotate questions from 40 challenging tasks with answer explanations, and various matched control explanations. We evaluate how different types of explanations, instructions, and controls affect zero- and few-shot performance. We analyze these results using statistical multilevel modeling techniques that account for the nested dependencies among conditions, tasks, prompts, and models. We find that explanations can improve performance -- even without tuning. Furthermore, explanations hand-tuned for performance on a small validation set offer substantially larger benefits, and building a prompt by selecting examples and explanations together substantially improves performance over selecting examples alone. Finally, even untuned explanations outperform carefully matched controls, suggesting that the benefits are due to the link between an example and its explanation, rather than lower-level features. However, only large models benefit. In summary, explanations can support the in-context learning of large LMs on challenging tasks.

연구 동기 및 목표

  • 소수의 예시 프롬프트에 답변 설명을 포함함으로써 어려운 과제에서 언어 모델 성능이 향상되는지 조사하는 것.
  • 설명의 이점이 예시와의 의미적 연결 때문인지, 낮은 수준의 언어적 특징 때문인지 결정하는 것.
  • 다양한 설명 유형, 지시어, 제어 조건이 제로-샷 및 소수의 예시 학습에 미치는 영향을 평가하는 것.
  • 설명으로 인한 성능 향상이 모델 크기에 따라 스케일링되는지, 특히 대규모 모델에서만 국한되는지 평가하는 것.
  • 40개의 다양한 어려운 과제로 구성된 새로운 벤치마크를 개발하고 공개하는 것. 이 과제들은 인간이 애너테이션한 설명과 제어 조건을 포함한다.

제안 방법

  • 예시와 대응하는 설명 및 일치하는 제어 설명을 포함한 40개의 다양한 어려운 NLP 과제를 애너테이션하여 설명의 내용 효과를 분리한다.
  • 다양한 변형을 가진 소수의 예시 프롬프트를 설계: 예시만, 예시 + 설명, 예시 + 지시어, 예시 + 제어 조건.
  • 1B에서 280B 파라미터에 이르는 여러 대규모 언어 모델을 사용하여 모든 프롬프트 변형에 대해 제로-샷 및 소수의 예시 설정에서 평가한다.
  • 과제, 프롬프트, 조건, 모델 간의 중첩된 의존성을 고려하기 위해 계층적 통계적 다중 수준 모델링을 사용한다.
  • 최고 성능을 내는 설명을 소규모 검증 세트를 통해 선택하여 프롬프트를 최적화하여 성능 향상을 극대화한다.
  • 설명의 인과적 영향을 분리하기 위해 뒤섞인 설명, 설명이 아닌 텍스트, 지시어가 아닌 콘텐츠와 같은 제어 조건을 비교한다.

실험 결과

연구 질문

  • RQ1소수의 예시 프롬프트에 답변 설명이 포함되면 대규모 언어 모델의 소수의 예시-제로-샷 성능이 향상되는가?
  • RQ2성능 향상은 예시와 설명 간의 의미적 연결 때문인가, 낮은 수준의 언어적 특징 때문인가?
  • RQ3수작업으로 조정된 설명은 조정되지 않은 것 또는 무작위로 선택된 것보다 더 큰 성능 향상을 가져오는가?
  • RQ4설명의 이점은 모델 크기에 따라 스케일링되는가, 아니면 대규모 모델에만 국한되는가?
  • RQ5예시와 설명을 함께 선택하는 것이 예시만 선택하는 것보다 성능 향상에 더 효과적인가?

주요 결과

  • 설명은 소수의 예시 학습에서 대규모 언어 모델(예: 280B 파라미터 모델)의 성능을 크게 향상시키며, 조정 없이도 효과를 보인다.
  • 조정되지 않은 설명이 철저히 일치하는 제어 조건보다 성능이 뛰어나며, 이는 이점이 표면적 특징이 아니라 예시-설명 간 의미적 연결 때문임을 시사한다.
  • 소규모 검증 세트를 통해 선택된 수작업으로 조정된 설명은 조정되지 않은 설명보다 훨씬 더 큰 성능 향상을 가져온다.
  • 예시와 설명을 함께 선택하는 것은 예시만 선택하는 것보다 유의미하게 더 좋은 성능을 낳는다.
  • 설명의 이점은 오직 대규모 언어 모델(≥7B 파라미터)에서만 관찰되며, 소규모 모델은 유의미한 향상이 없다.
  • 성능 향상 효과는 논리적 추론, 일반 지식 추론, 언어 이해와 같은 다양한 어려운 과제에서 견고하게 유지된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.