Skip to main content
QUICK REVIEW

[논문 리뷰] SikuGPT: A Generative Pre-trained Model for Intelligent Information Processing of Ancient Texts from the Perspective of Digital Humanities

Chang Liu, Dongbo Wang|arXiv (Cornell University)|2023. 04. 16.
Computational and Text Analysis Methods인용 수 4
한 줄 요약

SikuGPT는 『사자권서』 문헌 코퍼스로 미세조정된 생성형 사전 훈련 언어 모델로, 고전적 한문 텍스트의 지능적인 처리를 가능하게 한다. 이 모델은 기존의 GPT 기반 모델보다 고전적 한문 텍스트의 동어역역 번역 및 텍스트 분류 작업에서 뛰어난 성능을 보이며, 디지털 인문학 연구 및 전통 한문 문학 분야의 문화 지식 확산을 향상시킨다.

ABSTRACT

The rapid advance in artificial intelligence technology has facilitated the prosperity of digital humanities research. Against such backdrop, research methods need to be transformed in the intelligent processing of ancient texts, which is a crucial component of digital humanities research, so as to adapt to new development trends in the wave of AIGC. In this study, we propose a GPT model called SikuGPT based on the corpus of Siku Quanshu. The model's performance in tasks such as intralingual translation and text classification exceeds that of other GPT-type models aimed at processing ancient texts. SikuGPT's ability to process traditional Chinese ancient texts can help promote the organization of ancient information and knowledge services, as well as the international dissemination of Chinese ancient culture.

연구 동기 및 목표

  • 디지털 인문학 분야에서 고전적 한문 텍스트의 지능적 처리를 위한 전문화된 대규모 언어 모델 개발.
  • 기존 모델이 고전적 한문 고전 문헌의 문법적·어휘적 복잡성 처리에 한계를 보이는 문제 해결.
  • 고전적 한문 코퍼스에서의 동어역역 번역 및 텍스트 분류와 같은 후행 작업에서의 성능 향상.
  • 고대 지식의 정리 및 중국 문화 유산의 국제적 확산 지원.
  • 분야 전문화된 사전 훈련을 통한 AIGC 기술의 디지털 인문학 연구 통합 촉진.

제안 방법

  • 모델은 『사자권서』 코퍼스로 사전 훈련된 GPT 스타일의 자동회귀형 트랜스포머 아키텍처 기반.
  • 라벨이 부여된 데이터셋을 사용한 지도적 미세조정을 통한 후행 작업(동어역역 번역 및 텍스트 분류 포함)에 대한 미세조정 적용.
  • 고전적 한문의 문맥적 의미를 포착하기 위해 마스크된 언어 모델링 및 다음 토큰 예측 목표를 활용한 훈련 과정.
  • 혼합 정밀도 훈련과 그래디언트 체크포인팅을 활용한 효율성 향상을 위한 표준 딥러닝 프레임워크를 통한 최적화.
  • 저자원 고전적 텍스트 작업에서 일반화와 성능의 균형을 맞추기 위한 하이퍼파rameter 조정.
  • 고전적 한문 NLP 기준 평가 데이터셋에서 SikuGPT를 다른 GPT 기반 모델과 비교하여 평가 수행.

실험 결과

연구 질문

  • RQ1분야 전문화된 대규모 언어 모델이 고전적 한문 텍스트 처리에서 일반 목적 모델보다 뛰어난 성능을 보일 수 있는가?
  • RQ2SikuGPT는 고전적 한문을 포함한 동어역역 번역 작업에서 얼마나 효과적인가?
  • RQ3기존 모델 대비 SikuGPT는 고전적 한문 코퍼스에서 텍스트 분류 정확도를 얼마나 향상시키는가?
  • RQ4SikuGPT는 디지털 인문학 응용 분야에서 고대 중국 텍스트의 지식 정리 및 검색을 향상시킬 수 있는가?
  • RQ5『사자권서』 코퍼스에 대한 사전 훈련이 고전적 한문의 후행 NLP 성능에 어떤 영향을 미치는가?

주요 결과

  • SikuGPT는 고전적 한문을 포함한 동어역역 번역 작업에서 최신 기술 수준의 성능을 달성하여 다른 GPT 기반 모델을 뛰어넘는다.
  • 고전적 한문 데이터셋에서의 텍스트 분류 작업에서 뛰어난 정확도를 보이며, 강력한 의미 이해 능력을 나타낸다.
  • 『사자권서』 코퍼스에 대한 미세조정은 후행 고전적 한문 NLP 작업에서 제로샷 및 패기샷 일반화 능력을 크게 향상시킨다.
  • SikuGPT는 고전적 한문 문학에서 흔히 볼 수 있는 문법적 복잡성과 희귀어 처리에 있어 향상된 강건성을 보인다.
  • 모델은 지식 정리 및 문화 확산을 지원하기 위해 더 정확하고 맥락적으로 일관된 고전적 한문 텍스트 생성을 가능하게 한다.
  • 실증 결과는 고전적 한문 코퍼스에 대한 분야 전문화 사전 훈련이 후행 NLP 성능에 측정 가능한 향상을 이끌어낸다는 것을 확인한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.