Skip to main content
QUICK REVIEW

[논문 리뷰] Natural Instructions: Benchmarking Generalization to New Tasks from Natural Language Instructions

Swaroop Mishra, Daniel Khashabi|arXiv (Cornell University)|2021. 04. 18.
Topic Modeling참고 문헌 33인용 수 32
한 줄 요약

이 논문은 자연어 지시어 61종류와 60만 개의 작업 인스턴스를 포함하는 NATURAL INSTRUCTIONS라는 벤치마크를 소개한다. 이는 소수의 프롬프트 또는 파인튜닝를 통해 NLP 모델이 새로운 작업으로 일반화하는 능력을 평가하기 위한 것이다. 결과적으로 GPT-3나 BART와 같은 모델들이 지시어를 통해 성능 향상을 보이지만, 일반화 능력은 여전히 제한되어 있으며, 특히 다양한 지시어 도메인 간에서 두드러지게 나타나는 문제로 인해 지시어 따르기 일반화 능력 향상에 여전히 큰 개선 여지가 있음을 시사한다.

ABSTRACT

Can we enable NLP models to appropriately respond to instructional prompts and consequently generalize to new tasks? To study this question, we leverage the existing NLP datasets and the instructions that were used to crowdsource them to create NATURAL INSTRUCTIONS, a dataset of instructions and task-specific input/output data. This dataset consists of 61 distinct language instructions and about 600k task instances, and is used to evaluate existing state-of-the-art language-models (LMs) in addressing new tasks by few-shot prompting of GPT3 and fine-tuning BART. Our analysis indicates that: (a) the existing models indeed benefit from instructions and hence, show improved generalization to new tasks; (b) while models like GPT-3 generally benefit from instructions, the extent of their gains varies across different fields of instructions and also depends on the task being solved; (c) generalization to unseen tasks in NATURAL INSTRUCTIONS remains far from perfect for the state-of-the-art, indicating significant room for more progress in this direction.

연구 동기 및 목표

  • 언어 모델이 자연어 지시어로 프롬프트가 주어졌을 때 새로운 작업으로 일반화할 수 있는지 조사하기 위해.
  • 지시어-작업 쌍의 대규모이고 다양한 종류의 벤치마크를 구축하여 다양한 도메인 간 지시어 일반화 능력을 평가하기 위해.
  • GPT-3와 BART와 같은 최신 모델이 소수의 프롬프트 및 파인튜닝를 통해 새로운 작업에 일반화하는 성능을 평가하기 위해.
  • 지시어 유형과 작업 도메인이 모델의 일반화 성능에 미치는 영향을 분석하기 위해.
  • 지시어 튜닝에도 불구하고 새로운 작업으로의 일반화 능력에 여전히 견고한 격차가 존재하는지 확인하기 위해.

제안 방법

  • 기존의 NLP 데이터셋과 그 원래의 커뮤니티 기반 지침을 활용하여, 61종류의 고유한 언어 지시어와 약 60만 개의 입력-출력 작업 인스턴스를 포함하는 NATURAL INSTRUCTIONS 데이터셋을 구축하였다.
  • GPT-3를 사용한 소수의 프롬프트와 BART를 사용한 파인튜닝을 통해 제로샷 일반화를 평가하기 위해 이 데이터셋을 활용하였다.
  • 지시어를 분야별(예: 텍스트 분류, 시퀀스 레이블링 등)로 분류하여 도메인 간 성능 차이를 분석하였다.
  • 학습 중에 볼 수 없었던 작업 인스턴스에 대해 표준 NLP 메트릭을 사용하여 모델 성능을 평가하였다.
  • 다양한 지시어 유형과 작업 유형 간의 일반화 성능를 비교하여 모델 행동의 패턴을 규명하였다.

실험 결과

연구 질문

  • RQ1언어 모델이 새로운 작업으로 일반화할 때 자연어 지시어를 제공받는 것이 얼마나 유의미한 성능 향상을 이끌어내는가?
  • RQ2지시어 유형과 작업 도메인이 NLP 모델의 일반화 성능에 어떻게 영향을 미치는가?
  • RQ3GPT-3를 사용한 소수의 프롬프트와 BART를 사용한 파인튜닝이 NATURAL INSTRUCTIONS의 새로운 작업으로 일반화할 때 어떻게 비교되는가?
  • RQ4지시어 튜닝에도 불구하고 현재 모델이 새로운 작업으로 일반화하는 데에 있어 어떤 한계가 존재하는가?
  • RQ5일부 특정 지시어 분야에서는 일반화 성능가 항상 떨어지는가, 아니면 더 강한가?

주요 결과

  • GPT-3와 같은 언어 모델은 자연어 지시어를 제공받을 경우 일반화 능력에서 측정 가능한 향상을 보이며, 지시어 튜닝의 가치를 확인한다.
  • 지시어 유형과 작업 유형에 따라 성능 향상의 정도가 상당히 다름을 확인하였으며, 이는 도메인에 따라 효과가 달라짐을 시사한다.
  • 성능 향상이 이루어지긴 하지만, NATURAL INSTRUCTIONS에서 새로운 작업으로의 일반화 능력은 여전히 최적에 도달하지 못해, 현재 모델 능력의 심각한 격차를 드러낸다.
  • BART를 지시어-작업 쌍에 대해 파인튜닝하면 소수의 프롬프트보다 성능 향상이 이루어지지만, 다양한 지시어 유형에 걸쳐 일반화 능력은 여전히 제한되어 있다.
  • 모델은 지시어 분야 간에 일관되지 않은 성능을 보이며, 이는 지시어 다양성과 작업 복잡도가 일반화에 있어 핵심 과제임을 시사한다.
  • 결과적으로 지시어 따르기 능력 향상은 일반화 능력을 향상시키지만, 모든 작업에 대해 강건한 제로샷 또는 소수의 프롬프트 일반화를 달성하는 것은 여전히 열린 도전 과제임을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.