Skip to main content
QUICK REVIEW

[논문 리뷰] RAFT: A Real-World Few-Shot Text Classification Benchmark

Neel Alex, Eli Lifland|arXiv (Cornell University)|2021. 09. 28.
Topic Modeling참고 문헌 33인용 수 5
한 줄 요약

RAFT는 실제 연구보조원의 일과 유사한 자연스러운 작업을 사용하여 실생활 소수의 예제 텍스트 분류 벤치마크를 도입한다. 각 작업당 50개의 훈련 예제와 실제 배포 조건을 반영한 평가 설정을 포함한다. 이는 비전문가 인간이 GPT-3를 평균 F1 점수 0.11 높이면서도, 현재 모델이 장문의 텍스트 추론 및 다중 클래스 분류 과제에서 어려움을 겪고 있음을 드러낸다.

ABSTRACT

Large pre-trained language models have shown promise for few-shot learning, completing text-based tasks given only a few task-specific examples. Will models soon solve classification tasks that have so far been reserved for human research assistants? Existing benchmarks are not designed to measure progress in applied settings, and so don't directly answer this question. The RAFT benchmark (Real-world Annotated Few-shot Tasks) focuses on naturally occurring tasks and uses an evaluation setup that mirrors deployment. Baseline evaluations on RAFT reveal areas current techniques struggle with: reasoning over long texts and tasks with many classes. Human baselines show that some classification tasks are difficult for non-expert humans, reflecting that real-world value sometimes depends on domain expertise. Yet even non-expert human baseline F1 scores exceed GPT-3 by an average of 0.11. The RAFT datasets and leaderboard will track which model improvements translate into real-world benefits at https://raft.elicit.org .

연구 동기 및 목표

  • 실제 연구보조원이 수행하는 실생활 소수의 예제 텍스트 분류 과제를 반영하는 벤치마크를 구축하는 것.
  • 장기적인 입력 텍스트와 복잡한 지시어를 포함한 실제 배포 조건에 가까운 설정에서 소수의 예제 학습 성능을 평가하는 것.
  • 현재 언어 모델이 장문의 문서에서 추론을 수행하거나 고카디널리티 분류 과제를 처리하는 데 어려움을 겪는 한계를 규명하는 것.
  • 실생활 과제에서 인간의 기준 성능을 확립하여 인간 수준의 소수의 예제 분류 성능에 도달한 정도를 측정하는 것.
  • 모델 향상이 실제 실생활 이점을 가져올 수 있도록 공개 리더보드와 데이터셋을 제공하는 것.

제안 방법

  • 벤치마크는 실제 연구 워크플로우에서 수집한 11개의 자연스러운 텍스트 분류 데이터셋으로 구성되며, 각각 50개의 레이블된 훈련 예제와 더 큰 수의 레이블이 없는 테스트 세트를 포함한다.
  • 각 과제는 자연어 지시어와 레이블을 포함하며, 평가는 개인 테스트 레이블을 사용하는 Hugging Face 호스팅 리더보드를 통해 수행된다.
  • 인간 기준은 두 단계 과정(자격 테스트 20개 예제, 전체 레이블링 100개 예제)을 통해 커뮤니티 기반으로 수집되었으며, 레이블 충돌은 다수결 투표로 해결되었다.
  • 자동 기준은 GPT-3 및 앙상블 방법(예: n-gram 특징을 사용한 AdaBoost)을 사용하여 평가되었으며, 하이퍼파ram터는 한 개를 제외한 교차 검증을 통해 최적화되었다.
  • 평가 설정은 폐쇄책 제한을 피하고, 이진형이 아닌 정보가 풍부한 레이블을 사용하여 실생활 과제의 복잡성을 더 잘 반영한다.
  • 비지도 사전학습 및 개방형 검색을 장려하여 실제 배포 조건을 시뮬레이션한다.

실험 결과

연구 질문

  • RQ1현재 소수의 예제 언어 모델은 일반적으로 인간 연구보조원에게 위탁되는 실생활 텍스트 분류 과제에서 인간 성능을 따라잡을 수 있는가?
  • RQ2장기적인 입력 텍스트에서 추론이 필요한 과제에서 모델의 성능은 어떻게 되는가? 이는 실생활 응용에서 흔한 과제이다.
  • RQ3소수의 예제 학습에서의 모델 능력이 고카디널리티 분류 과제로 일반화되는 정도는 어느 정도인가?
  • RQ4특히 F1 점수와 분야 전문성 의존성 측면에서 인간의 성능은 최신 모델과 어떻게 비교되는가?
  • RQ5평가 설정의 어떤 구성 요소(예: 레이블의 정보성, 검색 액세스 등)가 모델 성능 추정에 가장 크게 영향을 미치는가?

주요 결과

  • 비전문가 인간 기준이 벤치마크 전반에서 GPT-3를 평균 F1 점수 0.11 높이면서, 현재 모델이 실생활 소수의 예제 과제에서 부족함을 드러낸다.
  • 현재 모델은 장문의 입력 텍스트에서 추론을 수행하는 데 심각한 어려움을 겪으며, 긴 문서를 포함한 데이터셋에서 열악한 성능을 보인다.
  • 높은 수의 클래스(예: 10개 이상의 카테고리)를 가진 과제는 주요 과제로 나타나며, 간단한 다중 클래스 과제에 비해 모델의 F1 점수가 뚜렷이 낮다.
  • 특정 분야의 전문 지식이 필요한 과제에서는 커뮤니티 기반 인간 기준 확보가 어려웠으며, 이는 실생활 가치가 종종 전문 지식에 의존함을 시사한다.
  • n-gram 특징을 사용한 AdaBoost를 사용한 자동 기준은 일부 과제에서 뛰어난 성능을 보였지만, 여전히 인간 기준에 뒤져 있었으며, 특히 장문의 맥락과 고카디널리티 과제에서 두드러지게 뒤졌다.
  • RAFT 벤치마크와 리더보드는 https://raft.elicit.org 에 공개되어 있으며, 실생활 소수의 예제 텍스트 분류 성능 향상을 추적하는 데 사용된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.