[論文レビュー] An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios
本論文は、中国語産業分野の8分野にわたり、10種類の巨大言語モデル(9つの中国現地型、4つのグローバル型)の正確性と耐性を包括的に評価する実証的調査を提示している。手作業で選別された1,200件の分野特化型問題と、8つの能力にわたる13,631件の変種質問を含むメタモーフィックテストフレームワークを用いて、すべてのLLMの正確性スコアが0.6未満であることが判明した。グローバルモデルは推論およびオープンエンドドタスクで現地モデルを上回ったが、中国語産業用語の理解に関しては現地モデルがより優れたパフォーマンスを示した。
Recent years have witnessed the rapid development of large language models (LLMs) in various domains. To better serve the large number of Chinese users, many commercial vendors in China have adopted localization strategies, training and providing local LLMs specifically customized for Chinese users. Furthermore, looking ahead, one of the key future applications of LLMs will be practical deployment in industrial production by enterprises and users in those sectors. However, the accuracy and robustness of LLMs in industrial scenarios have not been well studied. In this paper, we present a comprehensive empirical study on the accuracy and robustness of LLMs in the context of the Chinese industrial production area. We manually collected 1,200 domain-specific problems from 8 different industrial sectors to evaluate LLM accuracy. Furthermore, we designed a metamorphic testing framework containing four industrial-specific stability categories with eight abilities, totaling 13,631 questions with variants to evaluate LLM robustness. In total, we evaluated 9 different LLMs developed by Chinese vendors, as well as four different LLMs developed by global vendors. Our major findings include: (1) Current LLMs exhibit low accuracy in Chinese industrial contexts, with all LLMs scoring less than 0.6. (2) The robustness scores vary across industrial sectors, and local LLMs overall perform worse than global ones. (3) LLM robustness differs significantly across abilities. Global LLMs are more robust under logical-related variants, while advanced local LLMs perform better on problems related to understanding Chinese industrial terminology. Our study results provide valuable guidance for understanding and promoting the industrial domain capabilities of LLMs from both development and industrial enterprise perspectives. The results further motivate possible research directions and tooling support.
研究の動機と目的
- 先行のベンチマークが会話的または非産業的タスクに焦点を当てていたのに対し、本研究は現実の中国語産業生産文脈における巨大言語モデル(LLM)の正確性と耐性を評価することを目的とする。
- 中国語産業用LLMの分野特化型評価フレームワークの不足に応じ、中国ユーザー向けに特化したローカライズモデルの増加を踏まえ、その課題を解決することを目的とする。
- 中国現地型LLMとグローバル開発LLMの間で、正確性、耐性、分野特化型能力の観点から、多様な産業分野にわたるパフォーマンスを比較することを目的とする。
- 産業企業およびモデル開発者に対する、モデル選定、設定、将来のツール開発ニーズに関する実用的インサイトを提供することを目的とする。
- 再現可能で拡張可能な評価フレームワークを確立し、産業環境におけるLLMの評価を可能とし、他の言語や分野への適応可能性も有する。
提案手法
- 中国語産業分野の8分野にわたる多様な技術的・運用的課題をカバーする、1,200件の分野特化型問題からなる手作業によるベンチマークを構築した。
- 4つの産業特化型安定性カテゴリーと8つの能力を備えたメタモーフィックテストフレームワークを設計し、意味的摂動に対する耐性を評価するため、13,631件の変種質問を生成した。
- 温度を0に固定して決定論的出力を得る標準化された条件下で、10種類のLLM(中国ベンダーが開発した9つとグローバルモデル4つ)を評価した。
- 同義語置換、言い換え、論理的変換などの入力変更に対して、分野特化型メタモーフィック関係を適用し、一貫性をテストした。
- 人為的アノテーションによる正解と自動スコアリングを併用し、タスク全体における正確性と耐性を測定した。
- 分野ごとの大規模な実験を実施し、推論、用語理解、摂動下での安定性の違いに注目して、モデルパフォーマンスを比較した。
実験結果
リサーチクエスチョン
- RQ1中国現地型とグローバル開発LLMは、中国語文脈の実産業問題において、正確性でどのように比較されるか?
- RQ2LLMは産業生産タスクに関連する意味的変化に対して、どの程度耐性を保っているか?
- RQ3モデルパフォーマンスは異なる産業分野でどのように変化するのか。また、どの能力が摂動に対して最も感受性を示すか?
- RQ4ローカルLLMとグローバルLLMは、中国語産業用語の理解と論理的推論、オープンエンド生成の両面で、それぞれどのような相対的強みを示すか?
- RQ5メタモーフィックテストフレームワークは産業環境におけるLLM耐性を効果的に評価できるか。また、その一般化可能性は分野や言語にわたってどの程度あるか?
主な発見
- 評価対象のすべてのLLMが中国語産業ベンチマークで正確性スコア0.6未満を記録した。これは産業分野への導入におけるさらなる改善の余地が大きいことを示している。
- グローバルLLMは推論およびオープンエンド生成タスクで現地LLMを上回ったが、中国語産業用語の理解に関しては現地LLMが優れたパフォーマンスを示した。
- 耐性は能力ごとに顕著に異なることが判明。グローバルモデルは論理的・文法的変種に対してより強い耐性を示し、高度な現地モデルは用語関連摂動に対して優れた性能を発揮した。
- 全産業分野において、現地LLMはグローバルLLMに比べて全体的に低い耐性スコアを示した。これは入力変更に対する安定性の面でパフォーマンスギャップが存在することを示している。
- メタモーフィックテストフレームワークは、モデルや能力間のパフォーマンス差や感受性を効果的に同定した。産業用LLM評価における実用的価値を示している。
- モデルパフォーマンスは設定設定に感受性を示し、固定温度(0)が現実世界の効果を低く見積もる可能性がある。今後の評価において、ベンダーによるガイド付きキャリブレーションの必要性が示唆された。
より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。