[논문 리뷰] reStructured Pre-training
이 논문은 모델 사전 훈련과 미세조정을 구조화된 정보 처리로 간주하는 새로운 NLP 패러다임인 reStructured Pre-training (RST)를 소개한다. 이는 원시 텍스트보다는 구조화된 정보에 중점을 둔다. 10개의 소스에서 유래한 26종류의 다양한 신호를 포함한 재구성된 데이터로 사전 훈련한 결과 모델인 Qin은 55개의 NLP 벤치마크 중 52개에서 최신 기준의 제로샷 성능을 기록했으며, 2018년 고고고사 영어 시험에서는 150점 만점에 138.5점(평균 인간 성능보다 40점 높고, GPT-3보다 15점 높음)을 기록했고, 파rameter 수가 GPT-3의 1/16에 불과함에도 불구하고 성능을 뛰어넘었다.
In this work, we try to decipher the internal connection of NLP technology development in the past decades, searching for essence, which rewards us with a (potential) new learning paradigm for NLP tasks, dubbed as reStructured Pre-training (RST). In such a paradigm, the role of data will be re-emphasized, and model pre-training and fine-tuning of downstream tasks are viewed as a process of data storing and accessing. Based on that, we operationalize the simple principle that a good storage mechanism should not only have the ability to cache a large amount of data but also consider the ease of access. We achieve this by pre-training models over restructured data that consist of a variety of valuable information instead of raw data after overcoming several engineering challenges. Experimentally, RST models not only surpass strong competitors (e.g., T0) on 52/55 popular datasets from a variety of NLP tasks, but also achieve superior performance in National College Entrance Examination - English (Gaokao-English),the most authoritative examination in China. Specifically, the proposed system Qin achieves 40 points higher than the average scores made by students and 15 points higher than GPT3 with 1/16 parameters. In particular, Qin gets a high score of 138.5 (the full mark is 150) in the 2018 English exam (national paper III). We have released the Gaokao Benchmark with an online submission platform. In addition, we test our model in the 2022 College Entrance Examination English that happened a few days ago (2022.06.08), and it gets a total score of 134 (v.s. GPT3's 108).
연구 동기 및 목표
- NLP 기술 발전의 근본적 진화 패턴을 규명하고, 그 발전을 통합하는 가설을 제안하는 것.
- 기존 사전 훈련 패러다임의 한계를 해결하기 위해 원시 데이터에서 정보가 풍부한 구조화된 데이터 표현으로 초점을 이동시키는 것.
- 모델 사전 훈련을 데이터 저장 및 접근 메커니즘으로 간주하는 새로운 학습 패러다임—reStructured Pre-training (RST)—을 개발하는 것.
- 특정 작업에 맞는 미세조정 없이도 국가수능(고고고사 영어)에서 인간 수준의 성능을 달성할 수 있는 AI 시스템인 Qin을 구축하는 것.
- 실제 고위험 교육 시험, 예를 들어 고고고사 영어 시험과 같은 실제 세계의 고위험 시험에서 AI 성능을 평가하기 위한 공개 벤치마크 및 평가 플랫폼을 구축하는 것.
제안 방법
- RST는 사전 훈련을 구조화된 정보의 저장 및 효율적 검색 과정으로 재정의하며, 데이터는 명시적 개체, 품사, 문법적 의존성 등 26종류의 구체적 신호를 추출하고 정렬하도록 재구성된다.
- 이 방법은 위키피디아, CLOTH, BEA 2019, 고고고사 영어 시험 등 10개의 다양한 소스에서 데이터를 취합하여 통합적이고 정보가 풍부한 훈련 코퍼스를 구성한다.
- 각 데이터 유형에 대해 전용 데이터 구축 기법을 적용한다: 독해 능력 테스트에는 힌트 유무에 따라 클로즈 스타일 마스킹을, 문법 오류 인식 기반 데이터는 글쓰기 작업에 활용한다.
- 이러한 재구성된 데이터를 기반으로 통합된 목표 함수를 사용해 모델을 사전 훈련하며, 정보 접근성과 검색 효율성 최적화를 목표로 한다.
- 이러한 과정을 통해 도출된 일반화된 모델인 Qin은 사전 훈련된 상태에서 55개의 NLP 작업 전반에서 제로샷 설정으로 평가되며, 특정 작업에 대한 미세조정 없이도 실제 고고고사 영어 시험에 도전한다.
- ExplainaBoard를 활용해 상호작용식 랭킹 순위 및 고고고사 벤치마크를 배포하여 공개 평가 및 AI 성과의 장기적 추적을 가능하게 한다.
실험 결과
연구 질문
- RQ1NLP 기술 발전의 근본적 진화 패턴은 무엇이며, 이를 바탕으로 미래 혁신을 이끌 수 있는가?
- RQ2원시 텍스트가 아닌 재구성된 정보가 풍부한 데이터로 사전 훈련하면 제로샷 일반화에서 기존의 원시 데이터 기반 사전 훈련보다 성능이 뛰어나게 되는가?
- RQ3단일 통합 모델이 특정 작업에 대한 미세조정 없이도 고고고사 영어와 같은 고위험 실생활 시험에서 인간 수준의 성능을 달성할 수 있는 정도는 어느 정도인가?
- RQ4다양하고 이질적인 여러 소스에서 유래한 다양한 신호를 하나의 사전 훈련 프레임워크 안에서 어떻게 통합하고 효과적으로 활용할 수 있는가?
- RQ5사전 훈련에 데이터 중심 접근법을 적용하면 교육 분야에서 더 공정하고 확장 가능한 AI 응용이 가능해지는가?
주요 결과
- RST 모델은 분류, 정보 추출, 사실 검색, 텍스트 생성에 걸쳐 분포된 55개의 표준 NLP 벤치마크 중 52개에서 최신 기준의 제로샷 성능을 기록했다.
- 2018년 고고고사 영어 시험(국가지 3)에서 Qin 모델은 150점 만점에 138.5점(평균 인간 점수보다 40점 높고, GPT-3보다 15점 높음)을 기록했으며, 파라미터 수가 GPT-3의 1/16에 불과함에도 불구하고 성능을 뛰어넘었다.
- 2022년 수능(2022년 6월 8일)에서 모델은 고고고사 영어 시험에서 총점 134점을 기록했으며, GPT-3의 108점보다 뛰어난 성능을 보였다.
- 2018년 고고고사 영어 시험에서 听력 및 독해 이해 부분에서 모두 만점을 기록하여, 높은 난이도의 실생활 과제에서 뛰어난 성능을 입증했다.
- 2018~2021년 기간 동안의 10개의 애너테이션된 영어 시험지가 포함된 고고고사 벤치마크가 공개되었으며, 온라인 제출 플랫폼과 함께 제공되어 공개 평가 및 AI 성과의 장기적 추적을 가능하게 했다.
- RST의 성공은 원시 데이터 사전 훈련보다는 구조화되고 정보가 풍부한 데이터를 기반으로 한 사전 훈련이 더 효과적임을 입증하며, 데이터 중심 AI 개발 방향 전환을 뒷받침한다.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.