Skip to main content
QUICK REVIEW

[논문 리뷰] An Empirical Study on Large Language Models in Accuracy and Robustness under Chinese Industrial Scenarios

Zongjie Li, Wenying Qiu|arXiv (Cornell University)|2024. 01. 27.
Natural Language Processing Techniques인용 수 4
한 줄 요약

이 논문은 8개의 중국 산업 부문에서 10개의 대규모 언어 모델(9개의 중국 현지화 및 4개의 글로벌 모델)의 정확도와 내성에 대한 종합적인 실증 연구를 제시한다. 수작업으로 구성한 1,200개의 도메인 특화 문제와 8개의 능력에 걸쳐 13,631개의 변형 질문을 포함한 변형 테스팅 프레임워크를 사용하여, 모든 LLM의 정확도 점수가 0.6 이하로 나타났으며, 글로벌 모델은 추론 및 개방형 작업에서 현지 모델을 앞서며, 현지 모델은 중국 산업 용어 이해 능력에서 더 뛰어난 성능을 보였다.

ABSTRACT

Recent years have witnessed the rapid development of large language models (LLMs) in various domains. To better serve the large number of Chinese users, many commercial vendors in China have adopted localization strategies, training and providing local LLMs specifically customized for Chinese users. Furthermore, looking ahead, one of the key future applications of LLMs will be practical deployment in industrial production by enterprises and users in those sectors. However, the accuracy and robustness of LLMs in industrial scenarios have not been well studied. In this paper, we present a comprehensive empirical study on the accuracy and robustness of LLMs in the context of the Chinese industrial production area. We manually collected 1,200 domain-specific problems from 8 different industrial sectors to evaluate LLM accuracy. Furthermore, we designed a metamorphic testing framework containing four industrial-specific stability categories with eight abilities, totaling 13,631 questions with variants to evaluate LLM robustness. In total, we evaluated 9 different LLMs developed by Chinese vendors, as well as four different LLMs developed by global vendors. Our major findings include: (1) Current LLMs exhibit low accuracy in Chinese industrial contexts, with all LLMs scoring less than 0.6. (2) The robustness scores vary across industrial sectors, and local LLMs overall perform worse than global ones. (3) LLM robustness differs significantly across abilities. Global LLMs are more robust under logical-related variants, while advanced local LLMs perform better on problems related to understanding Chinese industrial terminology. Our study results provide valuable guidance for understanding and promoting the industrial domain capabilities of LLMs from both development and industrial enterprise perspectives. The results further motivate possible research directions and tooling support.

연구 동기 및 목표

  • 기존 벤치마크가 대화나 비산업적 작업에 집중한 바 있는 바, 실제 중국 산업 생산 환경에서의 대규모 언어 모델(LLM)의 정확도와 내성 평가를 목적으로 한다.
  • 특히 중국 사용자를 위한 맞춤형으로 개발된 국지화된 모델의 증가에 비추어, 중국 산업용 LLM에 대한 도메인 특화 평가 프레임워크의 부족을 보완한다.
  • 다양한 산업 부문에서 정확도, 내성, 도메인 특화 능력 측면에서 중국 현지화된 LLM과 글로벌로 개발된 LLM 간의 성능을 비교한다.
  • 산업 기업 및 모델 개발자들이 산업 AI 구현에서 모델 선택, 설정 조정, 향후 도구 개발 필요성에 대해 실질적인 통찰을 제공한다.
  • 다른 언어와 도메인으로의 적응 가능성을 고려해 재현 가능하고 확장 가능한 평가 프레임워크를 구축하여 산업 환경에서 LLM을 평가하는 데 기여한다.

제안 방법

  • 8개의 중국 산업 부문에서 기술적 및 운영적 과제를 포함하는 1,200개의 도메인 특화 문제로 구성된 수작업으로 구성된 벤치마크를 확보하였다.
  • 4개의 산업 특화 안정성 카테고리와 8개의 능력이 포함된 변형 테스팅 프레임워크를 설계하여, 의미적 변형에 대한 내성 평가를 위해 총 13,631개의 변형 질문을 생성하였다.
  • 온도를 0으로 설정하여 결정론적 출력을 확보한 상태에서 표준화된 조건에서 10개의 LLM(중국 벤더가 개발한 9개와 글로벌 모델 4개)을 평가하였다.
  • 동일한 도메인 특화된 변형 관계를 적용하여, 동의어 치환, 다듬힌 표현, 논리적 변환과 같은 입력 변형에 대한 일관성 테스트를 수행하였다.
  • 인간이 애너테이션한 참값과 자동 평가 점수를 조합하여, 작업 전반에 걸쳐 정확도와 내성을 측정하였다.
  • 다양한 산업 부문에서 대규모 실험을 수행하여 모델 성능을 비교하였으며, 주로 추론 능력, 용어 이해 능력, 입력 변형에 대한 안정성에 초점을 맞추었다.

실험 결과

연구 질문

  • RQ1중국 현지화된 LLM과 글로벌로 개발된 LLM은 중국 환경의 실제 산업 문제에서 정확도 측면에서 어떻게 비교될 수 있는가?
  • RQ2LLM은 산업 생산 작업에 관련된 의미적 변형에 얼마나 잘 견뎌내는가?
  • RQ3모델 성능은 다양한 산업 부문에서 어떻게 달라지며, 어떤 능력이 변형에 가장 민감한가?
  • RQ4현지 LLM과 글로벌 LLM은 중국 산업 용어 이해 능력과 논리적 추론, 개방형 생성 능력에서 각각 어떤 강점이 있는가?
  • RQ5변형 테스팅 프레임워크는 산업 환경에서 LLM의 내성을 효과적으로 평가할 수 있으며, 도메인과 언어에 걸쳐 일반화 가능한가?

주요 결과

  • 평가된 모든 LLM은 중국 산업 벤치마크에서 정확도 점수가 0.6 이하로 나타나, 산업 적용에서의 향상 여지가 크다는 것을 시사한다.
  • 글로벌 LLM은 추론 및 개방형 생성 작업에서 현지 LLM을 앞서며, 현지 LLM은 중국 산업 용어 이해 능력에서 뛰어난 성능을 보였다.
  • 내성 능력 간의 차이가 뚜렷하게 나타났으며, 글로벌 모델은 논리적 및 문법적 변형에 더 강한 내성을 보였고, 고급 현지 모델은 용어 관련 변형에 뛰어난 성능을 보였다.
  • 모든 산업 부문에서 현지 LLM의 내성 점수는 글로벌 모델보다 낮게 나타나, 입력 변형에 대한 안정성 측면에서 성능 격차가 뚜렷하게 드러났다.
  • 변형 테스팅 프레임워크는 모델 간 성능 차이와 민감도를 효과적으로 식별하여, 산업용 LLM 평가에 실용적인 도구로 기여함을 입증하였다.
  • 모델 성능은 설정 설정에 민감하게 반응하였으며, 온도를 고정(0)한 상태에서는 실제 적용 성능를 과소 평가할 수 있어, 향후 평가에서 제조사 가이드라인에 따른 校정이 필요함을 시사한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.