Skip to main content
QUICK REVIEW

[논문 리뷰] GrammarGPT: Exploring Open-Source LLMs for Native Chinese Grammatical Error Correction with Supervised Fine-Tuning

Yaxin Fan, Feng Jiang|arXiv (Cornell University)|2023. 07. 26.
Natural Language Processing Techniques인용 수 5
한 줄 요약

GrammarGPT는 중국어 어원적 문법 오류를 포함한 하이브리드 데이터셋(ChatGPT 생성 및 인간 레이블링된 데이터)을 사용하여 오픈소스 LLM을 위한 지도적 미세조정 방법을 제안한다. 기존 SOTA 기준 대비 1,061개의 병렬 데이터 샘플 뿐만으로도, 1,200배 적은 데이터로도 최신 기술 수준 성능을 달성하여 NLPCC2023 공동 과제에서 F0.5 점수 32.56(단어 수준) 및 35.84(문자 수준)로 3위를 기록하였다.

ABSTRACT

Grammatical error correction aims to correct ungrammatical sentences automatically. Recently, some work has demonstrated the excellent capabilities of closed-source Large Language Models (LLMs, e.g., ChatGPT) in grammatical error correction. However, the potential of open-source LLMs remains unexplored. In this paper, we introduced GrammarGPT, an open-source LLM, to preliminary explore its potential for native Chinese grammatical error correction. The core recipe of GrammarGPT is to leverage the hybrid dataset of ChatGPT-generated and human-annotated. For grammatical errors with clues, we proposed a heuristic method to guide ChatGPT to generate ungrammatical sentences by providing those clues. For grammatical errors without clues, we collected ungrammatical sentences from publicly available websites and manually corrected them. In addition, we employed an error-invariant augmentation method to enhance the ability of the model to correct native Chinese grammatical errors. We ultimately constructed about 1k parallel data and utilized these data to fine-tune open-source LLMs (e.g., Phoenix, released by The Chinese University of Hong Kong, Shenzhen) with instruction tuning. The experimental results show that GrammarGPT outperforms the existing SOTA system significantly. Although model parameters are 20x larger than the SOTA baseline, the required amount of data for instruction tuning is 1200x smaller, illustrating the potential of open-source LLMs on native CGEC. Our GrammarGPT ranks $3^{rd}$ on NLPCC2023 SharedTask1, demonstrating our approach's effectiveness. The code and data are available at \url{https://github.com/FreedomIntelligence/GrammarGPT}.

연구 동기 및 목표

  • 오픈소스 LLM이 어원적 중국어 문법 오류 교정(CGEC)에 얼마나 잠재력을 지닐 수 있는지 탐색한다. 이는 어원적 사용자로부터 발생하는 미묘한 오류를 포함하는 도전적인 과제이다.
  • 어원적 CGEC를 위한 고품질 병렬 학습 데이터 부족 문제를 해결하기 위해, ChatGPT 생성 데이터와 인간 레이블링 데이터를 융합한 하이브리드 데이터셋을 구축한다.
  • 이름 있는 실체를 대체함으로써 문법적 구조를 유지하면서도 의미적으로 유사하지만 다른 실체로 교체하는 오류 불변 증강 기법을 통해 모델의 일반화 능력과 오류 탐지 능력을 향상시킨다.
  • 소규모 고품질 하이브리드 데이터셋으로 오픈소스 LLM을 미세조정하는 것이, 기존 SOTA 시스템이 훨씬 더 큰 데이터셋(120만 개)으로 훈련된 것보다도 뛰어난 성능을 낼 수 있음을 입증한다.
  • 지시어 훈련과 하이브리드 데이터 컬렉션을 활용하여 재현 가능하고 오픈소스 기반의 어원적 CGEC 프레임워크를 구축한다.

제안 방법

  • 히우리스틱 프롬프팅 전략을 통해 ChatGPT에 문법적 단서 쌍(예: 초과 및 좌우)을 제공함으로써 중복 구성 요소 오류를 유도하는 비문장 생성을 유도한다.
  • 단서가 없는 오류의 경우, 공개 웹사이트에서 수집한 비문장들을 수작업으로 수정하여 병렬 학습 쌍을 구성한다.
  • ChatGPT 생성 데이터와 인간 레이블링 데이터를 융합하여 하이브리드 데이터셋을 구축하였으며, 이는 단서 기반 및 단서 없는 문법 오류를 모두 포함한다.
  • 오류 불변 증강 기법을 도입하여 문장 내 이름 있는 실체를 의미적으로 유사하지만 다른 실체로 교체함으로써 문법적 구조를 유지하면서도 훈련 다양성을 증가시킨다.
  • 1,061개의 병렬 예제로 구성된 하이브리드 데이터셋을 사용하여 오픈소스 LLM인 Phoenix(7B 파라미터)를 지시어 훈련을 통해 미세조정한다.
  • NLPCC2023 테스트 세트에서 F0.5, 정밀도, 재현율을 사용하여 모델 성능을 평가하고, S2S_BART와 같은 SOTA 기준과 비교한다.
Figure 1: The framework of our method.
Figure 1: The framework of our method.

실험 결과

연구 질문

  • RQ1소규모 고품질 하이브리드 데이터셋으로 미세조정된 오픈소스 LLM이 어원적 중국어 문법 오류 교정에서 최신 기술 수준 성능을 달성할 수 있는가?
  • RQ2LLM 생성 및 인간 레이블링 데이터를 융합한 하이브리드 데이터 생성 전략이 어원적 중국어의 미묘한 문법 오류를 얼마나 효과적으로 포착하는가?
  • RQ3오류 불변 증강 기법이 자원이 제한된 환경에서 모델의 오류 탐지 및 수정 능력을 어느 정도 향상시키는가?
  • RQ41,061개의 훈련 샘플이라는 상당히 작은 데이터셋이 외국어 학습자로부터 수집된 120만 개 샘플로 훈련된 기존 SOTA 시스템을 초월할 수 있는가?
  • RQ5LLM 생성 데이터와 인간 레이블링 데이터 중 어느 것이 어원적 CGEC에서 모델 성능에 더 큰 기여를 하는가?

주요 결과

  • GrammarGPT는 단어 수준에서 F0.5 점수 32.56, 문자 수준에서 35.84를 기록하여 SOTA 기준인 S2S_BART보다 두 지표 모두 약 15점 높은 성능을 보였다.
  • 기존 SOTA 기준 대비 1,061개의 훈련 샘플 뿐만으로도 뛰어난 성능을 달성하였으며, 이는 고품질 데이터 코딩의 효율성을 입증한다.
  • 모델은 NLPCC2023 공동 과제에서 3위를 기록하여 실제 환경 평가에서의 효과성을 입증하였다.
  • 제거 실험 결과, 하이브리드 데이터셋은 인간 레이블링 데이터나 ChatGPT 생성 데이터만 사용한 경우보다 우수했으며, 단어 수준에서 F0.5 27.30, 문자 수준에서 28.22를 기록하였다.
  • 오류 불변 증강 기법은 재현율과 F0.5 점수를 크게 향상시켜 오류 탐지 능력이 향상되었음을 시사하지만, 정밀도는 안정적으로 유지되었다.
  • ChatGPT 생성 데이터만으로도 인간 레이블링 데이터보다 높은 성능(F0.5: 단어 수준 18.49)을 기록하였으며, 이는 LLM이 대규모로 고품질이고 다양한 오류 패tern을 생성할 수 있음을 시사한다.
Figure 2: Process of ungrammatical sentences generated by ChatGPT.
Figure 2: Process of ungrammatical sentences generated by ChatGPT.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.