[论文解读] LLMs May Perform MCQA by Selecting the Least Incorrect Option
本文挑战了多项选择题问答(MCQA)作为评估大语言模型(LLMs)基准的有效性,揭示LLMs在多数情况下选择的是'最不错误'的选项,而非真正理解问题。通过在不同问题格式下进行系统性实验,作者识别出响应可变性综合症(REVAS),即模型性能因答案选项的微小变化而显著波动,这削弱了MCQA作为衡量真正理解能力的可靠性。
In the field of NLP, Large Language Models (LLMs) have markedly enhanced performance across a variety of tasks. However, the comprehensive evaluation of LLMs remains an inevitable challenge for the community. Recently, the adoption of Multiple Choice Question Answering (MCQA) as a benchmark for assessing LLMs has gained considerable traction. However, concerns regarding the robustness of this evaluative method persist. Building upon previous discussions on the issue of extit{variability}, we reveal an additional dimension of concern: LLMs may perform MCQA by selecting the least incorrect option rather than distinctly correct. This observation suggests that LLMs might regard multiple options as correct, which could undermine the reliability of MCQA as a metric for evaluating LLMs. To address this challenge, we introduce an enhanced dataset augmentation method for MCQA, termed MCQA+, to provide a more accurate reflection of the model performance, thereby highlighting the necessity for more sophisticated evaluation mechanisms in the assessment of LLM capabilities.
研究动机与目标
- 调查MCQA作为LLMs评估基准的可靠性。
- 识别当同一问题被重新表述或重构时LLM响应中的不一致性。
- 检验LLMs是否真正理解问题语义,还是仅在有缺陷的选项中选择最可能的选项。
- 探究在训练过程中引入负(错误)答案选项是否能提升模型的鲁棒性和一致性。
- 提出一种改进的评估框架,以考虑响应可变性,并促进深层理解而非表面模式匹配。
提出的方法
- 作者创建了MCQA实例的多种变体:原始版本、答案选项重新排序的版本,以及转换为是/非格式的版本。
- 他们在这些变体上评估了多个LLMs(包括LLaMA2-13B、Baichuan2-13B和ChatGPT 3.5),以测量响应一致性。
- 使用Baichuan2-7B-Base进行受控实验,通过在正(正确)和负(错误)答案对上进行训练,评估负样本的影响。
- 比较三种训练策略:仅SFT、在正样本上预训练后进行SFT,以及在正负样本上都预训练后进行SFT。
- 评估涵盖MCQA和是/非格式,以测试在不同问题结构下的泛化能力。
- 对不同配置下预测结果的变动进行统计分析,识别出REVAS现象,即尽管问题本质相同,模型输出仍显著波动。
实验结果
研究问题
- RQ1当同一问题以不同答案排序或格式呈现时,LLMs的性能是否保持一致?
- RQ2LLMs在MCQA中在多大程度上依赖于选项的相对合理性,而非语义理解?
- RQ3在预训练或微调过程中引入负(错误)答案选项,是否能提升LLMs响应的一致性并减少REVAS?
- RQ4为何当引入具有误导性的选项时,LLMs会频繁错误分类问题,即使它们最初是正确的?
- RQ5MCQA是否是评估LLMs真正知识获取和推理能力的有效代理?还是它主要衡量的是模式匹配?
主要发现
- LLMs在问题被重新表述或答案选项顺序改变时表现出显著的响应可变性——即响应可变性综合症(REVAS)——表明其推理过程不一致。
- 在少样本设置下,39.23%至57.99%的LLMs在用无误导性的选项替换后修正了初始误判,表明模型预测对选项内容高度敏感。
- 仅在正(正确)答案实例上进行预训练导致MCQA准确率下降15.59%,是/非准确率下降16.83%,表明仅学习正样本会损害泛化能力。
- 在预训练中引入负(错误)答案实例,相比仅SFT,使是/非准确率提升30.53%,MCQA准确率提升8.38%,证明从错误选项中学习具有重要价值。
- 研究证实LLMs通常选择的是'最不错误'的选项而非正确选项,暗示它们可能并未完全理解问题的语义。
- 实证结果表明,标准MCQA基准上的高准确率并不能反映真正的理解,因为当答案选项发生微小扰动时,性能会显著下降。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。