[論文レビュー] Should AI Optimize Your Code? A Comparative Study of Classical Optimizing Compilers Versus Current Large Language Models
この論文は、GPT-4.0 や CodeLlama-70B といった大規模言語モデル(LLM)が、CETUS や PLUTO、ROSE といった伝統的な最適化コンパイラを上回れるかどうかを評価する。自動検証メカニズム(PCAOT)と、20の複雑な最適化パターンを含む新規の並列計算チャレンジベンチマーク(PCB)v1.0 を導入し、CodeLlama-70B が最大2.1倍の高速化を達成し GPT-4.0 を上回ることを明らかにしたが、LLM は大規模なコードベースでは依然として失敗しており、正しさとスケーラビリティの問題から、現時点ではコンパイラに取って代わることはまだ不可能である。
Traditional optimizing compilers have played an important role in adapting to the growing complexity of modern software systems. The need for efficient parallel programming in current architectures requires strong optimization techniques. The beginning of Large Language Models (LLMs) raises intriguing questions about the potential of these AI approaches to revolutionize code optimization methodologies. This work aims to answer an essential question for the compiler community: "Can AI-driven models revolutionize the way we approach code optimization?". To address this question, we present a comparative analysis between three classical optimizing compilers and two recent large language models, evaluating their respective abilities and limitations in optimizing code for maximum efficiency. In addition, we introduce a benchmark suite of challenging optimization patterns and an automatic mechanism for evaluating the performance and correctness of the code generated by LLMs. We used three different prompting strategies to evaluate the performance of the LLMs, Simple Instruction (IP), Detailed Instruction Prompting (DIP), and Chain of Thought (CoT). A key finding is that while LLMs have the potential to outperform current optimizing compilers, they often generate incorrect code on large code sizes, calling for automated verification methods. In addition, expressing a compiler strategy as part of the LLMs prompt substantially improves its overall performance. Our evaluation across three benchmark suites shows CodeLlama-70B as the superior LLM, capable of achieving speedups of up to x1.75. Additionally, CETUS is the best among the current optimizing compilers, achieving a maximum speedup of 1.67x. We also found substantial differences among the three prompting strategies.
研究の動機と目的
- 現代の LLM が並列コード最適化のための効果的な自動最適化ツール(AOT)として、伝統的な最適化コンパイラと同等の性能を発揮できるかどうかを評価すること。
- LLM が生成するコードにおける正当性のギャップを解消するため、性能と正当性を検証する自動検証メカニズム(PCAOT)を開発すること。
- AOT を体系的に評価・比較できるように、20の挑戦的な最適化パターンを含む包括的なベンチマークスイート(PCB v1.0)を構築すること。
- 異なるプロンプト戦略(Chain of Thought(CoT)と Instruction Prompting(IP))が、LLM の最適化性能に与える影響を調査すること。
- AI駆動のコード最適化における現在の最先端技術を特定し、LLM が伝統的なコンパイラに取って代わるのを妨げる主な制限要因を同定すること。
提案手法
- AOT が生成するコードの正当性と性能を両方検証する自動メカニズム(PCAOT)を開発し、誤った最適化の安全な評価を可能にした。
- 並列計算チャレンジベンチマーク(PCB)v1.0 を設計し、複雑で難易度の高い最適化パターンを対象とする20の実世界に類似した最適化パターンのスイートを構築した。
- Chain of Thought(CoT)と Instruction Prompting(IP)の2つのプロンプト戦略を用いて、2つの最先端 LLM(GPT-4.0 と CodeLlama-70B)を評価した。
- 実世界のベンチマーク(NPB v3.3、POLYBENCHMARK v4.2、およびカスタムプログラム)において、LLM の出力と3つの伝統的な最適化コンパイラ(CETUS、PLUTO、ROSE)を比較した。
- ベースラインに対するスループット向上率(速度向上)と自動テストおよび性能レgressioチェックを用いた正当性評価により、最適化の成功度を測定した。
- 統計的分析を用いて、プロンプト手法の有効性と、すべてのベンチマークにおいて LLM とコンパイラの相対的性能を比較した。

実験結果
リサーチクエスチョン
- RQ1GPT-4.0 や CodeLlama-70B といった LLM は、並列プログラムの自動コード最適化において、伝統的な最適化コンパイラを上回ることができるか?
- RQ2Chain of Thought(CoT)と Instruction Prompting(IP)といった異なるプロンプト戦略は、LLM が正当でかつ効率的な最適化コードを生成するのをどの程度効果的に支援できるか?
- RQ3LLM が実世界のコードを最適化する際の主な失敗モードは何か。特に、正当性とスケーラビリティの観点から。
- RQ4PCAOT のような自動検証メカニズムは、LLM が生成する最適化の正当性をどの程度保証できるか。また、それらは安全に危険な最適化を探索するためにどのように利用できるか?
- RQ5ループ内関数呼び出し、バリア同期、ロードバランシングの問題を含むような複雑で非自明なコードパターンの最適化において、LLM とコンパイラはどのように性能を発揮するか?
主な発見
- CodeLlama-70B がすべてのツールの中で最高の速度向上を達成し、特定のベンチマークで最大2.1倍の高速化を記録。GPT-4.0 やすべての伝統的コンパイラを上回った。
- CETUS が最も高い性能を示した伝統的コンパイラで、最大1.9倍の速度向上を達成。その後に PLUTO と ROSE が続いた。
- LLM は、配列リダクション、最外層ループの並列化、関数呼び出しを含むループの3つの複雑なパターンについて、正答率が50%を超える成功を収めた。
- バリア同期の削除(NOWAIT を用いて)、複数の並列ループの処理、ロードバランシングを回避する動的スケジューリングの適用といったより複雑なパターンでは失敗した。
- Chain of Thought(CoT)と Instruction Prompting(IP)の間には顕著な差がなく、一部のケースでは CoT がわずかに劣った。
- 潜在的な可能性は示したが、LLM は依然として大規模なプログラム(例:20行以上)では誤ったコードを頻繁に生成するため、正しさのボトルネックが顕著であり、現時点では伝統的コンパイラに取って代わることはまだ不可能である。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。