Skip to main content
QUICK REVIEW

[논문 리뷰] Towards Comprehensive Vietnamese Retrieval-Augmented Generation and Large Language Models

Nguyen Quang Đuc, Le Hai Son|arXiv (Cornell University)|2024. 03. 03.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 베트남어 자연어 처리를 위한 포괄적인 오픈소스 데이터셋과 미세조정된 LLM을 소개한다. 포함된 자료로는 3200만 건의 기사로 구성된 뉴스코퍼스, 구조화된 사포 및 카테고리 데이터셋, 알파카 스타일의 지시 데이터, 합성 대화 데이터, 그리고 40GB와 120GB의 정제된 多국어 텍스트로 사전 훈련된 두 종류의 베트남어 최적화 LLaMA2-7b 모델이 있다. 주요 기여는 도메인 특화의 고품질 사전 훈련 데이터와 베트남어에 맞는 토크나이저를 통해 LLaMA2 대비 70% 감소한 토큰 수를 기록함으로써 베트남어 LLM 성능을 크게 향상시킨 것이다.

ABSTRACT

This paper presents our contributions towards advancing the state of Vietnamese language understanding and generation through the development and dissemination of open datasets and pre-trained models for Vietnamese Retrieval-Augmented Generation (RAG) and Large Language Models (LLMs).

연구 동기 및 목표

  • 베트남어 LLM 및 RAG 시스템을 위한 대규모 고품질 훈련 데이터 부족 문제를 해결하기 위해.
  • 다양한 NLP 작업을 위한 특화된 데이터셋을 구축함으로써 베트남어 언어 이해 및 생성 능력을 향상시키기 위해.
  • 다양하고 도메인 특화된 텍스트로의 지속적 사전 훈련과 맞춤형 베트남어 토크나이저를 통해 모델의 효율성과 성능을 향상시키기 위해.
  • 커뮤니티 협업을 위한 오픈 라이선스 하에 데이터셋과 모델을 공개함으로써 오픈 연구 생태계를 조성하기 위해.
  • 지시 테이닝, 의미 검색, 대화 생성 분야에서 최첨단 성능을 달성함으로써 베트남어 NLP의 발전을 이끌기 위해.

제안 방법

  • 2023년 11월까지의 뉴스 기사 데이터를 병합하고 중복 제거하여 총 3200만 건의 기사로 구성된 베트남어 뉴스코퍼스(53GB)를 구축하였다.
  • 문장 및 문단 임베딩 훈련을 위해 '제목-요약-내용' 형식의 뉴스사포 데이터셋(3170만 개의 트리플)을 제작하였다.
  • 베트남어 뉴스 기사(VnExpress)를 기반으로 21개 주제에 걸쳐 총 596,000개의 샘플을 포함하는 뉴스카테고리 데이터셋을 구축하였다.
  • GPT-4와 GPT-3.5를 활용해 지시 생성을 통해 두 가지 형식의 알파카 스타일 지시 데이터셋을 생성하였다: 하나는 '지시/입력/출력' 형식(5만 건)이며, 다른 하나는 '입력/출력' 형식(25,000 건)이다.
  • 지시 생성 및 GPT-4를 활용해 합성된 자기 대화 데이터셋(3만 개의 대화)을 개발하여 다단계 대화 능력을 향상시켰다.
  • MSMarco, SQuAD v2의 80%, Zalo 법적 챌린지 데이터셋의 일부를 통합하여 훈련한 베트남어 양방향 인코더 모델을 개발하였으며, 백본으로 PhoBERT-base-v2를 사용하여 Zalo 테스트 분할에서 73.28%의 Acc@1 성능을 달성하였다.

실험 결과

연구 질문

  • RQ1대규모 고품질의 베트남어 텍스트 데이터는 어떻게 체계적으로 수집하고 정제하여 LLM의 지속적 사전 훈련에 활용할 수 있는가?
  • RQ2도메인 특화의 다국어 사전 훈련 혼합 데이터는 베트남어 LLM의 하류 작업 성능에 얼마나 기여하는가?
  • RQ3맞춤형 베트남어 토크나이저는 표준 토크나이저 대비 토크나이징 오버헤드를 얼마나 줄이고 모델 효율성을 향상시킬 수 있는가?
  • RQ4합성된 지시 및 대화 데이터는 베트남어 LLM의 지시 따르기 능력과 대화 능력을 얼마나 효과적으로 향상시킬 수 있는가?
  • RQ540GB 대비 120GB의 다양한 베트남어 텍스트로 사전 훈련된 베이스 LLM은 어떤 성능 향상을 기대할 수 있는가?

주요 결과

  • 베트남어-LLaMA2-7b-120GB 모델은 총 124GB의 사전 훈련 데이터셋(베트남어 104GB, 영어 20GB)을 사용하여, 4개의 A100 GPU로 40일간 훈련되었으며 총 4000 GPU 시간이 소요되었다.
  • 맞춤형 베트남어 토크나이저는 베트남어 텍스트를 인코딩할 때 LLaMA2 대비 70% 감소한 토큰 수를 기록하였고, ChatGPT 대비 50% 감소하였다.
  • 베트남어 양방향 인코더 모델은 Zalo 법적 텍스트 검색 챌린지에서 73.28%의 Acc@1 성능을 달성하여, MSMarco로 사전 훈련된 PhoBERT-base-v2보다 25.44%포인트 높은 성능을 보였다.
  • '지시/입력/출력' 형식의 5만 건의 지시 미세조정된 알파카 데이터셋은 GPT-4와 GPT-3.5를 활용해 생성되어 다양한 고품질 지도 미세조정을 가능하게 하였다.
  • '입력/출력' 형식의 25,000건 데이터셋은 더 긴 폭넓은 출력을 생성하여 대화 및 지시 작업에서 모델의 응답 품질을 향상시켰다.
  • 뉴스카테고리 데이터셋은 세계, 비즈니스, 건강, 엔터테인먼트 등 주제를 포함해 총 596,524개 샘플로 구성되어 21개 클래스의 텍스트 분류를 가능하게 하여 강력한 주제 모델링을 가능케 하였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.