Skip to main content
QUICK REVIEW

[논문 리뷰] Cross-Task Generalization via Natural Language Crowdsourcing Instructions

Swaroop Mishra, Daniel Khashabi|arXiv (Cornell University)|2021. 04. 18.
Mobile Crowdsensing and Crowdsourcing인용 수 5
한 줄 요약

이 논문은 자연어 지시와 입력-출력 쌍을 포함한 61개의 NLP 작업으로 구성된 대규모 데이터셋인 Natural Instructions를 소개한다. 이는 다양한 작업 간 일반화를 연구하기 위한 것이다. 지시와 입력에 기반해 생성형 언어 모델을 미세조정함으로써, 저자들은 새로운 작업에 대해 0-샷 일반화 성능을 19% 향상시켰음을 보여주며, 지시가 다양한 작업 간 전이 능력을 크게 향상시킨다는 것을 입증한다. 다만, 여전히 이론적 최상한 성능에 도달하지 못하고 있음을 확인한다.

ABSTRACT

Humans (e.g., crowdworkers) have a remarkable ability in solving different tasks, by simply reading textual instructions that define them and looking at a few examples. Despite the success of the conventional supervised learning on individual datasets, such models often struggle with generalization across tasks (e.g., a question-answering system cannot solve classification tasks). A long-standing challenge in AI is to build a model that learns a new task by understanding the human-readable instructions that define it. To study this, we introduce NATURAL INSTRUCTIONS, a dataset of 61 distinct tasks, their human-authored instructions, and 193k task instances (input-output pairs). The instructions are obtained from crowdsourcing instructions used to create existing NLP datasets and mapped to a unified schema. Using this meta-dataset, we measure cross-task generalization by training models on seen tasks and measuring generalization to the remaining unseen ones. We adopt generative pre-trained language models to encode task-specific instructions along with input and generate task output. Our results indicate that models benefit from instructions when evaluated in terms of generalization to unseen tasks (19% better for models utilizing instructions). These models, however, are far behind an estimated performance upperbound indicating significant room for more progress in this direction.

연구 동기 및 목표

  • 언어 모델이 자연어 지시만을 기반으로 새로운 작업으로 일반화할 수 있는지 연구하기 위해.
  • NLP에서 다양한 작업 간 일반화를 평가하기 위한 표준화되고 통합된 벤치마크를 구축하기 위해.
  • 다양한 지시 구성 요소(예: 정의, 예시)가 모델 성능에 미치는 영향을 조사하기 위해.
  • 현재 모델 능력과 지시 기반 일반화의 이론적 최상한 성능 간 격차를 측정하기 위해.

제안 방법

  • 저자들은 기존의 커뮤니티 기반 데이터셋에서 61개의 서로 다른 NLP 작업에 걸쳐 총 193만 개의 작업 인스턴스를 수집하였다.
  • 인간이 작성한 지시를 추출하고 통일된 스키마로 정리하였으며, 정의, 예시, 제약 조건 등의 필드를 포함하였다.
  • 입력과 작업별 지시를 조건으로 하여 출력을 생성하도록 미세조정된 BART 모델을 훈련시켰다.
  • 다양한 작업 간 일반화 평가를 위해, 본 적 있는 작업에 대해 훈련하고 본 적 없는 작업에 대해 테스트하여 0-샷 성능을 측정하였다.
  • 인간 평가자들이 지시 구성 요소의 실질적 유용성을 평가하여 그 영향을 검증하였다.
  • 모델 예측의 오류 분석을 수행하여, 사실 복사 또는 답변 불가 질문 생성과 같은 일반적인 실패 유형을 파악하였다.

실험 결과

연구 질문

  • RQ1언어 모델이 지시와 입력-출력 쌍만으로 새로운 NLP 작업으로 일반화할 수 있는가?
  • RQ2자연어 지시의 구성 요소(예: 정의, 예시) 중에서 다양한 작업 간 일반화에 가장 크게 기여하는 요소는 무엇인가?
  • RQ3지시 기반 훈련 방식은 데이터만으로 훈련하는 기존의 방법과 비교해 0-샷 일반화 성능에서 어떻게 다를까?
  • RQ4현재 모델의 성능과 지시 기반 일반화의 이론적 최상한 성능 사이의 격차는 얼마인가?

주요 결과

  • 지시를 포함해 미세조정한 모델는 데이터 샘플만으로 훈련된 모델보다 새로운 작업에서 19% 높은 성능를 보였다.
  • 지시에 정의 및 예시 필드를 포함시킬 경우, 특히 분류 및 최소한의 텍스트 수정 작업에서 모델의 일반화 능력이 크게 향상되었다.
  • 오류 분석 결과, 모델가 자주 입력된 사실을 복사하거나 답변 불가능한 질문을 생성하는 경향을 보여, 추론 능력과 지시 준수 능력의 한계를 드러냈다.
  • 인간 평가자들은 정의 및 '피해야 할 사항' 필드가 가장 유용하다고 평가하였으며, 이는 모델 성능에 미치는 영향과 일치하였다.
  • 비록 성능 향상이 있었지만, 여전히 모델의 성능은 추정된 최상한 성능에 크게 못 미치며, 지시 기반 일반화 분야에서 향후 더 큰 발전 여지가 있음을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.