Skip to main content
QUICK REVIEW

[논문 리뷰] Can Large Language Model Comprehend Ancient Chinese? A Preliminary Test on ACLUE

Yixuan Zhang, Haonan Li|arXiv (Cornell University)|2023. 10. 14.
Topic ModelingComputer Science인용 수 3
한 줄 요약

이 논문은 고대 한문 이해 능력을 평가하기 위한 종합적 벤치마크인 ACLUE를 소개한다. 이는 어휘, 문법, 의미, 지식 기반 이해 영역에서 총 15개의 과제를 포함한다. 제로샷 평가에서 중국어 모델인 ChatGLM2가 평균 정확도 37.4%를 기록하며 가장 높은 성능을 보였지만, 현대 중국어 벤치마크 수준에는 훨씬 못 미쳐, 대규모 언어 모델(LM)이 고대 중국어를 다룰 때 여전히 향상 여지가 크다는 점을 시사한다.

ABSTRACT

Large language models (LLMs) have showcased remarkable capabilities in understanding and generating language. However, their ability in comprehending ancient languages, particularly ancient Chinese, remains largely unexplored. To bridge this gap, we present ACLUE, an evaluation benchmark designed to assess the capability of language models in comprehending ancient Chinese. ACLUE consists of 15 tasks cover a range of skills, spanning phonetic, lexical, syntactic, semantic, inference and knowledge. Through the evaluation of eight state-of-the-art LLMs, we observed a noticeable disparity in their performance between modern Chinese and ancient Chinese. Among the assessed models, ChatGLM2 demonstrates the most remarkable performance, achieving an average score of 37.4%. We have made our code and data public available.

연구 동기 및 목표

  • 대규모 언어 모델(LM)이 고대 중국어를 이해하는 데 있어 표준화된 평가 벤치마크가 부족한 문제를 해결하기 위해.
  • 최신 기술의 대규모 언어 모델이 다양한 고대 중국어 언어 과제에 대해 제로샷 및 인라인 희소 few-shot 능력을 얼마나 갖추고 있는지 평가하기 위해.
  • 제로샷 프롬프팅과 작업 특화 미세조정 없이도 호환 가능한 통합 다중 선택 형식의 벤치마크를 제공하기 위해.
  • 어휘, 문법, 의미, 지식 기반 이해 등 다양한 과제 유형에서의 모델 성능 분석하기 위해.
  • 벤치마크에서 자동 생성된 질문과 수동으로 수집된 질문의 품질과 난이도를 평가하기 위해.

제안 방법

  • ACLUE는 공개 자료에서 수동으로 수집한 질문과 고대 중국어 문헌에서 자동 생성한 질문을 조합하여 15개 과제를 구성한다.
  • 모든 과제는 네 가지 선택지를 가진 다중 선택 문제 형식으로 구성되어 있어 제로샷 및 인라인 학습 평가 프로토콜과 일관되고 호환 가능하다.
  • 과제는 발음, 어휘, 문법, 의미, 추론, 일반 지식 능력 등을 포함하며, 기원전 2070년부터 기원 1368년까지의 시대를 아우르는 시, 산문, 역사 기록, 전기 등 다양한 장르를 다룬다.
  • 자동 질문 생성은 어휘의 다의어 해소 및 명칭 엔터티 인식 등 기존에 주석이 달린 자료를 활용하여 다의어 해소 및 동음이의 문자 식별과 같은 과제를 생성한다.
  • 모델 평가는 미세조정 없이 제로샷 및 오차샷 인라인 프롬프팅을 사용하여 일반화 능력과 희소 적응 능력을 평가한다.
  • 성능 평가는 모든 과제에서의 정확도로 측정되며, 자동 생성된 질문과 수동 수집된 질문의 데이터 기원에 따라 과제 유형별로 성능을 통계적으로 비교 분석한다.
Figure 2: The performance of ChatGPT and ChatGLM2 on ACLUE of different categories.
Figure 2: The performance of ChatGPT and ChatGLM2 on ACLUE of different categories.

실험 결과

연구 질문

  • RQ1대규모 언어 모델은 작업 특화 미세조정 없이도 고대 중국어를 이해할 수 있는가?
  • RQ2최신 기술의 대규모 언어 모델은 다양한 고대 중국어 언어 이해 과제에서 어떤 성능을 보이는가?
  • RQ3자동 생성된 질문과 수동으로 수집된 질문의 상대적 난이도는 고대 중국어 이해 평가에서 어떻게 다를까?
  • RQ4어떤 모델 아키텍처가 고대 중국어에 대해 더 뛰어난 일반화 능력을 보이며, 어떤 과제 유형에서 뛰어난 성능을 내는가?
  • RQ5대규모 언어 모델의 성능을 저해하는 주요 과제는 무엇이며, 특히 동음이의 문자 해소 및 장기 문맥 이해 능력과 같은 과제에서 어떤 어려움이 있는가?

주요 결과

  • ChatGLM2는 제로샷 평가에서 모든 15개 과제에서 평균 정확도 37.4%를 기록하여 가장 높은 성능을 보였다. 이는 ChatGPT와 같은 多언어 모델보다 뛰어난 성능을 보였다.
  • ChatGPT는 평균 정확도 36.9%를 기록하여 다른 모델보다 略적으로 낮지만, 과제 간 일관성 있는 성능을 보였다.
  • 모든 모델이 동음이의 문자 해소 과제(T2)에서 매우 낮은 성능을 보였으며, 정확도가 랜덤 추측 수준(25%)에 가까워, 고대 중국어에서 음운적 대체를 이해하는 데 근본적인 한계를 드러냈다.
  • 장기 입력 길이(평균 약 1,000 토큰)로 인해 독해력 과제(T8)는 큰 도전 과제가 되었으며, BLOOMZ, LLaMA, Baichuan 등의 모델에 특히 영향을 미쳐 장기 문맥 처리 능력의 제한을 시사했다.
  • BLOOMZ는 대련 예측 과제(T5)에서 60.2%의 정확도를 기록했으며, 이는 데이터셋 출처와 훈련 데이터의 중복으로 인한 것으로 보이며, 데이터 분포 민감도를 강력히 시사한다.
  • ACLUE의 자동 생성 질문은 수동 수집 질문과 유사한 난이도와 신뢰성을 보였으며, 이는 대규모 언어 모델 평가에 자동 생성 질문을 활용할 수 있음을 뒷받침한다.
Figure 3: The performance comparison of LLMs on ACLUE across different data origins.
Figure 3: The performance comparison of LLMs on ACLUE across different data origins.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.