QUICK REVIEW
[论文解读] AixBench: A Code Generation Benchmark Dataset
Yiyang Hao, Ge Li|arXiv (Cornell University)|Jun 27, 2022
Software Engineering Research被引用 11
一句话总结
AixBench 是一个针对 Java 的方法级代码生成基准,包含 175 个样本用于通过单元测试进行自动化正确性评估,以及 161 个样本用于人工质量评估。该基准引入了一项新的自动度量指标(AvgPassRatio)和人工评估标准,表明 aiXcoder XL 和 GitHub Copilot 在正确性方面表现优异(pass@1: ~46-49%),且代码质量出色,其中 Copilot 在可维护性方面略胜一筹。
ABSTRACT
We present a benchmark dataset for evaluating method-level code generation task. The benchmark contains a dataset of 175 samples for automated evaluation and a dataset of 161 samples for manual evaluation. We also present a new metric for automatically evaluating the correctness of the generated code, and a set of criteria to manually evaluating the overall quality of the generated code.
研究动机与目标
- 为解决现有基准中缺乏对真实世界、可测试功能的 Java 方法描述进行代码生成模型评估的问题。
- 提供一个支持自动化与人工评估的语料库,包含非英文提示(中文和英文)。
- 开发一项新的自动度量指标 AvgPassRatio,其能比 pass@k 更好地反映实际应用中的实用性,通过测量每个样本的测试用例通过率的平均比例。
- 建立一个标准化的人工评估框架,包含三个维度:正确性、代码质量和可维护性。
- 在真实、面向生产环境的基准上评估最先进的代码生成模型,如 aiXcoder XL 和 GitHub Copilot。
提出的方法
- 自动化测试数据集包含 175 个函数描述,附带函数签名和手工编写的单元测试,以支持自动化正确性评估。
- 自然语言任务描述数据集包含 161 个函数描述,其清晰度和模糊性各不相同,用于评估模型的鲁棒性及人工评估的质量。
- 引入一项新度量指标 AvgPassRatio,用于衡量每个样本通过测试用例的平均比例,提供比 pass@k 更实用的度量方式。
- 人工评估采用三维评分体系:正确性(1–4 分)、代码质量(1–3 分)、可维护性(1–5 分)。
- 自然语言描述源自开源 Java 项目,经优化以确保可测试性和清晰度,同时保留自然语言的多样性。
- 使用自动化测试通过率和人工标注者评分对模型在两个数据集上进行评估。
实验结果
研究问题
- RQ1代码生成模型在具有自动化测试用例的真实、面向生产环境的 Java 基准上表现如何?
- RQ2AvgPassRatio 度量指标是否能比 pass@k 更好地反映生成代码的实际效用?
- RQ3在模糊或不完整的自然语言描述下,aiXcoder XL 和 GitHub Copilot 在正确性和代码质量方面表现如何比较?
- RQ4非英文提示(中文)在代码生成任务中对模型性能的影响程度如何?
- RQ5正确性、代码质量和可维护性的人工评估标准与自动化测试结果之间是否存在相关性?
主要发现
- aiXcoder XL 在 175 个样本的自动化测试集上取得 pass@1 得分为 49.14%,而 GitHub Copilot 得分为 46.29%。
- aiXcoder XL 的 AvgPassRatio 为 68.68%,GitHub Copilot 为 69.55%,表明两者生成的代码均能通过较高比例的测试用例。
- 在人工评估中,GitHub Copilot 的可维护性得分为 3.0931,高于 aiXcoder XL 的 2.9937,表明其代码结构和可读性更优。
- 两者在正确性得分上相近(2.9503 vs. 2.9875),表明在功能需求方面表现均较强。
- aiXcoder XL 的代码质量得分为 2.2049,略高于 GitHub Copilot 的 2.1739,但差异微小。
- 该基准成功捕捉了真实开发中的挑战,包括描述模糊和非英文提示等问题,并为代码生成模型提供了可靠的评估框架。
更好的研究,从现在开始
从阅读论文到最终审阅,大幅缩短您的研究时间。
无需绑定信用卡
本解读由 AI 生成,并经人工编辑审核。