QUICK REVIEW
[論文レビュー] AixBench: A Code Generation Benchmark Dataset
Yiyang Hao, Ge Li|arXiv (Cornell University)|Jun 27, 2022
Software Engineering Research被引用数 11
ひとこと要約
AixBench は、Java のメソッドレベルでのコード生成を評価するベンチマークであり、自動正しさ評価のための 175 個のサンプルと、手動による品質評価のための 161 個のサンプルを含む。新しい自動評価指標(AvgPassRatio)と手動評価基準を導入し、aiXcoder XL と GitHub Copilot が両方とも高い正しさ(pass@1: 約 46–49%)と優れたコード品質を達成していることが示された。特に、保守性において GitHub Copilot がわずかに優れている。
ABSTRACT
We present a benchmark dataset for evaluating method-level code generation task. The benchmark contains a dataset of 175 samples for automated evaluation and a dataset of 161 samples for manual evaluation. We also present a new metric for automatically evaluating the correctness of the generated code, and a set of criteria to manually evaluating the overall quality of the generated code.
研究の動機と目的
- テスト可能な正しさを評価できる、実世界の機能的 Java メソッド記述を対象としたベンチマークの不足を補うこと。
- 自動評価と手動評価の両方を可能にするデータセットを提供すること。非英語のプロンプト(中国語および英語)も含むこと。
- pass@k よりも現実の有用性をよりよく反映するため、部分的なテスト通過率を測定する新しい自動指標、AvgPassRatio を開発すること。
- 正しさ、コード品質、保守性の3次元からなる標準化された手動評価フレームワークを確立すること。
- aiXcoder XL や GitHub Copilot などの最先端コード生成モデルを、現実的で生産指向のベンチマークで評価すること。
提案手法
- 自動テストデータセットには、正しさの自動評価を可能にするために、関数の記述と手作業で作成されたユニットテストを備えた 175 個の関数記述が含まれる。
- NL タスク記述データセットには、明確さや曖昧さのばらつきがある関数記述が 161 個含まれ、モデルの頑健性と手動評価の品質を評価する。
- pass@k よりも実用的であるとされる、1サンプルあたりのテストケース通過率の平均を測定する新しい指標、AvgPassRatio が導入された。
- 手動評価には3次元スコアリングシステムが用いられ、正しさ(1–4点)、コード品質(1–3点)、保守性(1–5点)の評価が行われる。
- 自然言語記述は、オープンソースの Java プロジェクトから収集され、テスト可能性と明確さを高めるために改善されたが、自然言語のバリエーションは保持された。
- モデルは、自動テスト通過率と人間のアノテーターによる手動スコアリングの両方で、2つのデータセットに対して評価された。
実験結果
リサーチクエスチョン
- RQ1自動テストケースを備えた現実的で生産指向の Java ベンチマークにおいて、コード生成モデルはどの程度の性能を示すか?
- RQ2AvgPassRatio という指標は、pass@k よりも生成コードの実用的有用性をよりよく反映できるか?
- RQ3曖昧または不完全な自然言語記述に対して、aiXcoder XL や GitHub Copilot などのモデルは、正しさとコード品質においてどのように比較されるか?
- RQ4中国語などの非英語プロンプトは、コード生成タスクにおけるモデルのパフォーマンスにどの程度影響を与えるか?
- RQ5正しさ、コード品質、保守性の手動評価基準は、自動テスト結果とどの程度相関するか?
主な発見
- aiXcoder XL は、175 サンプルの自動テストセットで pass@1 スコア 49.14% を達成したのに対し、GitHub Copilot は 46.29% を記録した。
- aiXcoder XL の AvgPassRatio は 68.68%、GitHub Copilot は 69.55% であり、両モデルとも高い割合のテストケースを通過するコードを生成していることが示された。
- 手動評価において、GitHub Copilot は保守性(3.0931)で aiXcoder XL(2.9937)を上回っており、より良いコード構造と可読性を示している。
- 両モデルの正しさスコアはほぼ同等(2.9503 対 2.9875)であり、機能要件を満たす優れたパフォーマンスを示している。
- コード品質スコアは、aiXcoder XL(2.2049)が GitHub Copilot(2.1739)をわずかに上回っており、差は小さいが顕著である。
- このベンチマークは、曖昧な記述や非英語プロンプトを含む実世界の開発課題を的確に捉えており、コード生成モデルの信頼性ある評価フレームワークを提供している。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。