[論文レビュー] HumanEval-XL: A Multilingual Code Generation Benchmark for Cross-lingual Natural Language Generalization
HumanEval-XL は、23 種類の自然言語(NLs)と 12 種類のプログラミング言語(PLs)を結ぶ大規模かつ多言語対応のコード生成ベンチマークを提供する。全 22,080 個のプロンプトが用意されており、1 タスクあたり平均 8.33 個のテストケースを含む。このベンチマークにより、コード生成における多言語間自然言語一般化の包括的評価が可能となり、モデルサイズと専門的なコード事前学習が多言語コード生成性能を顕著に向上させることを明らかにした。一方で、現在のモデルは多様な自然言語間で意味的同等性を維持する能力に欠けることが判明した。
Large language models (LLMs) have made significant progress in generating codes from textual prompts. However, existing benchmarks have mainly concentrated on translating English prompts to multilingual codes or have been constrained to very limited natural languages (NLs). These benchmarks have overlooked the vast landscape of massively multilingual NL to multilingual code, leaving a critical gap in the evaluation of multilingual LLMs. In response, we introduce HumanEval-XL, a massively multilingual code generation benchmark specifically crafted to address this deficiency. HumanEval-XL establishes connections between 23 NLs and 12 programming languages (PLs), and comprises of a collection of 22,080 prompts with an average of 8.33 test cases. By ensuring parallel data across multiple NLs and PLs, HumanEval-XL offers a comprehensive evaluation platform for multilingual LLMs, allowing the assessment of the understanding of different NLs. Our work serves as a pioneering step towards filling the void in evaluating NL generalization in the area of multilingual code generation. We make our evaluation code and data publicly available at \url{https://github.com/FloatAI/humaneval-xl}.
研究の動機と目的
- 多様な自然言語とプログラミング言語をカバーする多言語コード生成の包括的ベンチマークの不足に対処すること。
- 英語中心または限定的言語にとどまらない環境において、大規模言語モデル(LLMs)の多言語間自然言語一般化能力を厳密に評価すること。
- 23 種類の自然言語と 12 種類のプログラミング言語を結ぶ標準化された並列ベンチマークを確立し、多言語 LLM の理解力とコード生成能力を評価すること。
- モデルスケールと専門的なコード事前学習が多言語コード生成性能に与える影響を調査すること。
提案手法
- 23 種類の自然言語と 12 種類のプログラミング言語間で並列なコーディング問題を構築し、言語的・構文的整合性を確保する。
- 各プロンプトを 23 種類の自然言語に翻訳し、12 種類のプログラミング言語における同等のコードにマッピングすることで、並列な多言語データセットを構成する。
- 全 22,080 個のプロンプトが含まれており、1 タスクあたり平均 8.33 個のテストケースを有することで、コード正しさの堅牢な評価が可能となる。
- 生成コードの成否を評価するために pass@k メトリクスが使用される。
- 3 種類の LLM ファミリー(CodeT5+、CodeGen2、GPT-3.5、GPT-4)を用いて、さまざまなパラメータスケールで実験が実施された。
- 本ベンチマークは https://github.com/FloatAI/HumanEval-XL にて公開され、再現性とコミュニティ利用を目的としている。
実験結果
リサーチクエスチョン
- RQ1大規模言語モデルは、23 種類の多様な自然言語において、コード生成タスクでどの程度一般化できるか?
- RQ2モデルサイズが、さまざまなプログラミング言語における多言語コード生成性能に与える影響は何か?
- RQ3一般多言語事前学習と比較して、専門的なコード事前学習は多言語間コード生成能力にどのような影響を及ぼすか?
- RQ4同じコーディングタスクを異なる自然言語に翻訳して生成する際、現在の LLM はどの程度意味的同等性を維持できるか?
- RQ5本ベンチマークは、低リソース自然言語における言語的バイアスや性能低下を検出できるか?
主な発見
- モデルサイズは多言語コード生成性能と強く正の相関を示し、大規模モデルがすべての言語とプログラミング言語で顕著に高い pass@k スコアを達成している。
- 専門的なコード事前学習は、特に低リソース言語環境においてコード生成品質を向上させる上で画期的な役割を果たしている。
- 英語では高い性能を示すものの、現在の LLM は非英語プロンプトからのコード生成において意味的同等性を維持できず、多言語間一般化能力の不足が顕在化している。
- GPT-4 はすべての言語と PL で最高の pass@1 スコアを記録しており、特に低リソース言語ペアにおいて CodeT5+ や CodeGen2 モデルを上回っている。
- Tagalog や Swahili、Uzbek のような多くの低リソース言語では、すべてのモデルでほぼゼロに近い性能を示しており、多言語モデルの一般化における顕著なギャップが浮き彫りになっている。
- 本ベンチマークは、高パラメータ数モデルですらすべての 23 種類の自然言語に効果的に一般化できないことを明らかにした。これにより、コード LLM の多言語間整合性向上に向けたさらなる取り組みの必要性が強調された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。