[論文レビュー] A Survey on LLM-based Code Generation for Low-Resource and Domain-Specific Programming Languages
本調査では、2020年から2024年までの111編の論文を系統的文献レビューとして実施し、低リソース言語(LRPLs)およびドメイン特化言語(DSLs)における大規模言語モデル(LLM)ベースのコード生成を分析する。主な課題として、データ不足や専門的意味論の存在を特定し、既存のベンチマーク、メトリクス、モデル改善戦略を評価した。また、標準化された評価フレームワークの欠如を指摘し、この未開拓分野における今後の研究の基盤を提示した。
Large Language Models (LLMs) have shown impressive capabilities in code generation for popular programming languages. However, their performance on Low-Resource Programming Languages (LRPLs) and Domain-Specific Languages (DSLs) remains a significant challenge, affecting millions of developers-3.5 million users in Rust alone-who cannot fully utilize LLM capabilities. LRPLs and DSLs encounter unique obstacles, including data scarcity and, for DSLs, specialized syntax that is poorly represented in general-purpose datasets. Addressing these challenges is crucial, as LRPLs and DSLs enhance development efficiency in specialized domains, such as finance and science. While several surveys discuss LLMs in software engineering, none focus specifically on the challenges and opportunities associated with LRPLs and DSLs. Our survey fills this gap by systematically reviewing the current state, methodologies, and challenges in leveraging LLMs for code generation in these languages. We filtered 111 papers from over 27,000 published studies between 2020 and 2024 to evaluate the capabilities and limitations of LLMs in LRPLs and DSLs. We report the LLMs used, benchmarks, and metrics for evaluation, strategies for enhancing performance, and methods for dataset collection and curation. We identified four main evaluation techniques and several metrics for assessing code generation in LRPLs and DSLs. Our analysis categorizes improvement methods into six groups and summarizes novel architectures proposed by researchers. Despite various techniques and metrics, a standard approach and benchmark dataset for evaluating code generation in LRPLs and DSLs are lacking. This survey serves as a resource for researchers and practitioners at the intersection of LLMs, software engineering, and specialized programming languages, laying the groundwork for future advancements in code generation for LRPLs and DSLs.
研究の動機と目的
- LLMベースのコード生成研究において、低リソースおよびドメイン特化プログラミング言語(LRPLsおよびDSLs)が軽視されているという、既存の文献における重要なギャップを解決すること。
- LRPLsおよびDSLsにおけるLLMのコード生成の現状を系統立てて分析し、評価メトリクス、ベンチマーク、モデル改善技術に焦点を当てる。
- LRPLsおよびDSLsに特化したデータ収集およびキュレーション戦略を特定・分類し、限られた学習データと専門的意味論による特異な課題を考慮する。
- LRPLsおよびDSLsにおける標準化されたベンチマークおよび評価メトリクスの欠如を強調し、高リソースプログラミング言語(HRPLs)と比較してその課題を対比する。
- クロスリンガル転移、中間表現、形式的検証技術を含む、特殊分野におけるコード生成を前進させるための実行可能な研究機会を提供すること。
提案手法
- 2020年から2024年までの27,000件を超える研究から111件の論文を系統的文献レビュー(SLR)で絞り込み、包括的カバーを確保するため、2024年から2025年の追加のスノーボール法および拡張検索を実施。
- 評価技術を4つの主要なタイプに分類し、LRPLsおよびDSLsにおけるコード生成パフォーマンスを評価するために使用される14種類以上のメトリクスを分析。これには構文的・意味的正しさが含まれる。
- モデル改善戦略を6つの主要グループに分類:ファインチューニング、プロンプト工学、リtrieーブ・アンクレートド・ジェネレーション(RAG)、蒸留、コト・オブ・スコウト(Chain-of-Thought)プロンプト、合成データを用いたファインチューニング。
- 文献で使用されたデータセットをマッピングおよび分析し、特に低リソース言語向けに、ウェブスクレイピング、リポジトリからのマイニング、手動アノテーションなどのキュレーション手法に焦点を当てる。
- コード生成およびDSLにおける評価を向上させるために、中間言語表現や記号実行といった新規アーキテクチャおよび技術を検討した。
- LRPLsおよびDSLsのアプローチを比較するための構造化フレームワークを用い、特にドメイン特化構文、意味論、専門知識要件によって生じる、DSLsに特有の課題を同定した。
実験結果
リサーチクエスチョン
- RQ1低リソースおよびドメイン特化プログラミング言語におけるLLMベースのコード生成を評価するために、現在どのベンチマーク、メトリクス、評価技術が使用されているか?
- RQ2文献で提案されている、LRPLsおよびDSLsにおけるLLMパフォーマンスを向上させるためのメソドロジーおよびモデル改善戦略は何か?
- RQ3LRPLおよびDSLの文脈におけるLLMのトレーニングおよび評価のため、データセットはどのように収集・キュレーション・前処理されているか?
- RQ4データ不足とドメイン特化性の観点から、LRPLsとDSLsにおけるコード生成の課題とアプローチの主な違いは何か?
- RQ5LRPLsおよびDSLsにおける評価の標準化の欠如と統一されたベンチマークの不在に対処するための研究機会は何か?
主な発見
- 関心が高まる一方で、多くのLRPLsおよびDSLsは、Pythonのような高リソース言語とは異なり、標準化されたベンチマークや評価メトリクスを欠いている。
- MultiPL-Eベンチマークでは顕著なパフォーマンス格差が示され、Rust や R といったLRPLsではPythonほど高いスコアを達成できていない。
- モデル改善戦略として6つの主要なカテゴリーを同定:ファインチューニング、プロンプト工学、RAG、蒸留、コト・オブ・スコウト(Chain-of-Thought)プロンプト、合成データ生成。
- LRPLsおよびDSLsのデータ収集は、ウェブスクレイピング、GitHubマイニング、手動キュレーションに大きく依存しているが、これらの方法はしばしば限られた、ノイズが多い、または代表的でないデータセットを生じる。
- DSLsはLRPLsよりも顕著な課題に直面しており、高度に特化した構文・意味論に加え、専門知識やドメイン特化ツールの必要性がある。
- 研究機会としては、形式的同等性チェッカーの開発、HRPLsからのクロスリンガル転移学習、中間言語表現、記号実行や定理証明を統合した意味的検証技術の統合が挙げられる。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。