[论文解读] Can Large Language Model Comprehend Ancient Chinese? A Preliminary Test on ACLUE
本文提出ACLUE,这是首个针对大语言模型(LLMs)在古汉语理解方面进行全面评估的基准,涵盖词汇、句法、语义和知识型理解的15项任务。在零样本评估中,中文模型ChatGLM2取得了37.4%的平均准确率,显著低于现代汉语基准水平,凸显尽管在现代语言任务中表现优异,LLMs在古汉语理解方面仍有巨大提升空间。
Large language models (LLMs) have showcased remarkable capabilities in understanding and generating language. However, their ability in comprehending ancient languages, particularly ancient Chinese, remains largely unexplored. To bridge this gap, we present ACLUE, an evaluation benchmark designed to assess the capability of language models in comprehending ancient Chinese. ACLUE consists of 15 tasks cover a range of skills, spanning phonetic, lexical, syntactic, semantic, inference and knowledge. Through the evaluation of eight state-of-the-art LLMs, we observed a noticeable disparity in their performance between modern Chinese and ancient Chinese. Among the assessed models, ChatGLM2 demonstrates the most remarkable performance, achieving an average score of 37.4%. We have made our code and data public available.
研究动机与目标
- 为解决大语言模型(LLMs)在古汉语理解方面缺乏标准化评估基准的问题。
- 评估最先进LLMs在多样化古汉语语言理解任务上的零样本和上下文少样本能力。
- 提供一个统一的多项选择格式基准,兼容零样本提示,并独立于特定任务的微调。
- 分析模型在不同任务类型(包括词汇、句法、语义和知识型理解)上的表现。
- 评估自动生成问题与人工整理问题在评估古汉语理解能力方面的质量与难度。
提出的方法
- ACLUE通过结合公开来源的人工精选问题和从古典汉语语料库自动生成的问题,构建了15项任务。
- 所有任务均采用四选一多项选择题格式,确保与零样本和上下文学习评估协议的一致性与兼容性。
- 任务涵盖语音、词汇、句法、语义、推理和通用知识技能,涵盖从诗歌、散文到历史记录和传记等体裁,时间范围为公元前2070年至1368年。
- 自动问题生成利用现有带标注的语料库,包括词义和命名实体标注,以生成多义词消解和同音异形字识别等任务。
- 模型评估采用零样本和五样本上下文提示两种方式,以评估模型在无微调情况下的泛化能力与少样本适应能力。
- 性能通过所有任务上的准确率进行衡量,并对不同任务类别和数据来源(自动生成 vs. 人工收集)的模型表现进行统计分析。

实验结果
研究问题
- RQ1大语言模型在无特定任务微调的情况下能否理解古汉语?
- RQ2最先进LLMs在多样化古汉语语言理解任务上的表现如何?
- RQ3自动生成问题与人工整理问题在评估古汉语理解能力时的相对难度如何?
- RQ4哪些模型架构在古汉语理解上表现出更优的泛化能力,且在哪些任务类别中表现更佳?
- RQ5限制LLMs在古汉语理解中表现的关键挑战是什么,特别是在同音异形字识别和长上下文阅读理解等任务中?
主要发现
- 在零样本评估中,ChatGLM2在全部15项任务中取得了37.4%的最高平均准确率,优于多语言模型如ChatGPT。
- ChatGPT的平均准确率为36.9%,表现略低但各项任务间更为稳定,优于其他模型。
- 所有模型在同音异形字识别(T2)任务上的表现均较差,准确率接近随机猜测(25%),表明LLMs在理解古汉语中语音替代方面存在根本性局限。
- 阅读理解(T8)任务构成重大挑战,因输入长度较长(平均约1,000个token),尤其影响BLOOMZ、LLaMA和Baichuan等模型,表明其长上下文处理能力有限。
- BLOOMZ在对联预测(T5)任务中取得了60.2%的准确率,可能由于其训练数据与数据集来源存在重叠,凸显数据分布敏感性。
- ACLUE中的自动生成问题在难度和可靠性方面与人工整理问题相当,支持其在大规模LLM评估中的应用。

更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。