Skip to main content
QUICK REVIEW

[논문 리뷰] What Changes Can Large-scale Language Models Bring? Intensive Study on HyperCLOVA: Billions-scale Korean Generative Pretrained Transformers

Boseop Kim, HyoungSeok Kim|arXiv (Cornell University)|2021. 09. 09.
Topic Modeling참고 문헌 43인용 수 4
한 줄 요약

이 논문은 5600억 토큰 분량의 한국어 코퍼스를 기반으로 훈련된 820억 파라미터의 한국어 생성형 사전학습 전이 모델인 HyperCLOVA를 소개한다. 이 모델은 한국어 자연어 처리 작업에서 최신의 인라인 zero-shot 및 few-shot 성능을 보이며, 언어 특화 토크나이제이션 방법을 제안하고 프롬프트 기반 학습(p-tuning 등)을 통합하여 성능을 향상시켰다. 또한, 비전문가가 최소한의 머신러닝 전문 지식으로도 AI 애플리케이션을 프로토타이핑할 수 있도록 도와주는 GUI 기반의 프롬프트 엔지니어링 인터페이스인 HyperCLOVA Studio를 도입하여 No Code AI 패러다임을 선도한다.

ABSTRACT

GPT-3 shows remarkable in-context learning ability of large-scale language models (LMs) trained on hundreds of billion scale data. Here we address some remaining issues less reported by the GPT-3 paper, such as a non-English LM, the performances of different sized models, and the effect of recently introduced prompt optimization on in-context learning. To achieve this, we introduce HyperCLOVA, a Korean variant of 82B GPT-3 trained on a Korean-centric corpus of 560B tokens. Enhanced by our Korean-specific tokenization, HyperCLOVA with our training configuration shows state-of-the-art in-context zero-shot and few-shot learning performances on various downstream tasks in Korean. Also, we show the performance benefits of prompt-based learning and demonstrate how it can be integrated into the prompt engineering pipeline. Then we discuss the possibility of materializing the No Code AI paradigm by providing AI prototyping capabilities to non-experts of ML by introducing HyperCLOVA studio, an interactive prompt engineering interface. Lastly, we demonstrate the potential of our methods with three successful in-house applications.

연구 동기 및 목표

  • 모델 크기와 프롬프트 엔지니어링 효과에 대한 종합적 분석이 부족한 대규모 비영어 언어 모델의 부족을 보완하기 위해.
  • 한국어와 같이 자소문자어이 많고 자원이 적은 언어에서 언어 특화 토크나이제이션이 인라인 학습 성능에 미치는 영향을 조사하기 위해.
  • 대규모 인라인 학습 LMs에서 연속형 프롬프트 기반 튜닝(예: p-tuning)이 효과적으로 적용될 수 있는지 확인하기 위해.
  • 비전문가가 인터랙티브한 GUI 기반 프롬프트 엔지니어링 플랫폼(HyperCLOVA Studio)을 통해 모델 훈련 없이도 AI 시스템을 프로토타이핑할 수 있도록 하기 위해.
  • 단일 대규모 LLM을 기반으로 다양한 애플리케이션을 위한 No Code AI 패러다임의 잠재력을 탐색하기 위해.

제안 방법

  • 언어적 및 문화적으로 관련성이 높은 자료에 중점을 두고 웹 크롤링과 데이터 정제를 통해 한국어 중심의 5600억 토큰 분량의 코퍼스를 구축하였다.
  • 한국어의 복합적 접착어형을 더 잘 처리하기 위해 바이트 수준의 BPE와 형태소 분석기를 조합한 하이브리드 토크나이제이션 방법을 설계하였다.
  • 표준 GPT-3 스타일의 자동회귀 언어 모델링 목표를 사용하여 390억 및 820억 파라미터의 HyperCLOVA를 훈련시켰다.
  • 메인 모델 파라미터를 미세조정하지 않고도 인라인 학습 성능을 향상시키기 위해 연속형 프롬프트 튜닝(p-tuning)을 적용하였다.
  • 비기술자 사용자를 위한 GUI 및 API 접근 기능을 제공하는 웹 기반 인터랙티브 인터페이스인 HyperCLOVA Studio를 개발하였다.
  • 입력 기울기 기반 프롬프트 튜닝을 통합하여 소량의 데이터로도 성능을 향상시키고, 적은 데이터로도 고성능을 달성할 수 있도록 하였다.

실험 결과

연구 질문

  • RQ1언어 특화 토크나이제이션이 대규모 비영어 LMs에서 인라인 학습 성능에 어떤 영향을 미치는가?
  • RQ2한국어 NLP 작업에서 중간 크기(390억)와 대규모(820억) LMs 간의 zero-shot 및 few-shot 설정에서의 성능 차이는 어떠한가?
  • RQ3p-tuning과 같은 연속형 프롬프트 기반 최적화 방법이 수십억 규모의 LMs에서 인라인 학습에 효과적으로 적용될 수 있는가?
  • RQ4비전문가가 인터랙티브한 프롬프트 엔지니어링 인터페이스를 통해 모델 훈련 없이도 고성능 AI 프로토타입을 구축할 수 있는 정도는 어느 정도인가?
  • RQ5단일 대규모 LLM이 비전문가 영역에서 AI 개발을 민주화하는 데 기여할 수 있는 No Code AI 패러다임을 실현할 수 있는가?

주요 결과

  • 820억 파라미터의 HyperCLOVA는 여러 한국어 NLP 벤치마크에서 최신의 인라인 zero-shot 및 few-shot 성능을 달성하였다.
  • 제안된 한국어 특화 토크나이제이션 방법은 표준 BPE 대비 다운스트림 작업 성능을 크게 향상시켰으며, 특히 형태소적으로 복잡한 맥락에서 두드러진 성능 향상을 보였다.
  • p-tuning은 분류 및 생성 작업 전반에서 표준 프롬프트 템플릿과 few-shot 기준선을 능가하는 성능 향상을 이끌어내었다.
  • 중간 크기의 HyperCLOVA 모델(390억)은 강력한 few-shot 일반화 성능를 보이며, 확장성과 효율성 간의 트레이드오프가 관리 가능함을 시사하였다.
  • HyperCLOVA Studio를 통해 비전문가가 최소한의 데이터와 모델 훈련 없이도 전문가 수준의 성능을 보이는 AI 애플리케이션을 프로토타이핑할 수 있었다.
  • 입력 기울기 기반 프롬프트 튜닝 통합으로 비전문가조차도 소량의 예시로 최신 성능을 달성할 수 있었으며, 이는 No Code AI의 실용적 타당성을 입증하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.