Skip to main content
QUICK REVIEW

[论文解读] Multiple-Choice Questions are Efficient and Robust LLM Evaluators

Ziyin Zhang, Zhaokun Jiang|arXiv (Cornell University)|May 20, 2024
Customer churn and segmentationBusiness, Management and Accounting被引用 3
一句话总结

本文提出将开放式 LLM 评估基准(如 GSM8K 和 MATH)转换为多项选择(MC)格式——GSM-MC 和 MATH-MC——通过从 50 多个开源模型收集正确答案和错误预测,以生成稳健的干扰项。该方法利用模型 logits 实现高效、准确的评估,评估时间最多减少 30 倍,同时与原始基准性能保持高度相关性(r > 0.9),即使在干扰项选择和选项顺序变化的情况下亦保持稳定。

ABSTRACT

We present GSM-MC, a multiple-choice (MC) dataset constructed by collecting answers and incorrect predictions on GSM8K from 60 open-source models. Through extensive experiments, we show that LLMs' performance on the MC version of this popular benchmark is strongly correlated with their performance on the original version and is quite robust to distractor choices and option orders, while the evaluation time is reduced by a factor of up to 30. Following similar procedures, we introduce MATH-MC, constructed from MATH, and PythonIO, a new program reasoning MC dataset constructed from HumanEval and MBPP. Experimental results indicate that LLMs' performance on these MC benchmarks leaves much room for improvement. Our data and code are available at https://github.com/Geralt-Targaryen/MC-Evaluation.

研究动机与目标

  • 解决在 GSM8K 和 MATH 等开放式基准上 LLM 评估中出现的无效或格式错误答案的问题。
  • 减少因从模型生成结果中启发式提取答案而导致的评估时间和假阴性。
  • 通过利用来自模型预测的精心筛选干扰项的多项选择格式,提升 LLM 评估的鲁棒性。
  • 通过引入程序输出预测任务(PythonIO),将多项选择评估范式扩展至代码生成基准。
  • 证明多项选择评估是标准开放式评估的可靠、高效且稳健的替代方案。

提出的方法

  • 通过从 50 多个开源 LLM 在 GSM8K 和 MATH 上的预测中提取正确答案和错误预测,构建 GSM-MC 和 MATH-MC。
  • 使用模型生成的错误答案作为干扰项,形成多项选择选项,确保语义上的合理性。
  • 将原始问题重新格式化为包含 4–8 个选项的多项选择格式,确保结构和答案格式的一致性。
  • 通过将 HumanEval 和 MBPP 转换为程序输出预测任务,开发 PythonIO,模型需从多个选项中选择正确输出。
  • 使用 logits 直接提取预测结果对 LLM 在 MC 版本上进行评估,避免因文本解析错误导致的问题。
  • 通过系统性消融研究,测试不同选项数量、干扰项集合和选项顺序排列组合下的鲁棒性。

实验结果

研究问题

  • RQ1将 GSM8K 和 MATH 等开放式基准转换为多项选择格式,是否能保持与原始基准的模型性能相关性?
  • RQ2MC 评估对干扰项质量和选项顺序变化的鲁棒性如何?
  • RQ3与标准开放式生成相比,MC 评估在多大程度上减少了评估时间?
  • RQ4MC 评估范式能否有效扩展至 HumanEval 和 MBPP 等代码生成基准?
  • RQ5MC 评估是否能缓解因输出格式错误或无效导致的假阴性问题?

主要发现

  • LLM 在 GSM-MC 和 MATH-MC 上的表现与原始 GSM8K 和 MATH 基准表现具有强相关性(r > 0.9),涵盖所有测试的模型规模和设置。
  • MC 评估对干扰项变化和选项顺序变化具有鲁棒性,即使使用来自不同模型的预测替换干扰项,性能仍保持稳定。
  • 通过直接从模型 logits 提取预测结果,而非解析生成的文本,评估时间最多减少 30 倍。
  • 所提出的 PythonIO 数据集使基于多项选择格式的代码生成模型评估更加高效和准确,避免了代码生成中的解析错误。
  • 指令微调模型在开放式格式下表现出显著更多的无效答案,但 MC 转换通过标准化输出格式缓解了此问题。
  • 即使仅使用 2 个选项,该方法在不同 MC 配置下仍保持高评估保真度,证明了其可扩展性和可靠性。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。