Skip to main content
QUICK REVIEW

[논문 리뷰] LLMs for Science: Usage for Code Generation and Data Analysis

Mohamed Nejjar, Luca Zacharias|arXiv (Cornell University)|2023. 11. 28.
Scientific Computing and Data Management인용 수 9
한 줄 요약

이 논문은 과학 분야의 코딩 작업에서 LLM 기반 도구들을 실증적으로 평가하고, 코드 생성, 데이터 분석, 데이터 시각화에 중점을 두며, 편향(confabulation) 같은 강점, 약점, 위험성을 논의한다.

ABSTRACT

Large language models (LLMs) have been touted to enable increased productivity in many areas of today's work life. Scientific research as an area of work is no exception: the potential of LLM-based tools to assist in the daily work of scientists has become a highly discussed topic across disciplines. However, we are only at the very onset of this subject of study. It is still unclear how the potential of LLMs will materialise in research practice. With this study, we give first empirical evidence on the use of LLMs in the research process. We have investigated a set of use cases for LLM-based tools in scientific research, and conducted a first study to assess to which degree current tools are helpful. In this paper we report specifically on use cases related to software engineering, such as generating application code and developing scripts for data analytics. While we studied seemingly simple use cases, results across tools differ significantly. Our results highlight the promise of LLM-based tools in general, yet we also observe various issues, particularly regarding the integrity of the output these tools provide.

연구 동기 및 목표

  • 현재의 LLM 기반 도구가 과학 연구에서 코딩 관련 작업(코드 생성, 데이터 분석, 데이터 시각화)을 어떻게 지원하는지 탐색한다.
  • 여러 도구에 걸쳐 생성된 코드와 분석의 정확성, 효율성, 이해 용이성을 평가한다.
  • 연구 워크플로우에서 도구 간 차이점, 한계 및 위험(예: 산출물 무결성, 허구화)을 식별한다.

제안 방법

  • 일련의 LLM 기반 도구를 선택한다(ChatGPT GPT-3.5, ChatGPT GPT-4, Google Bard, Bing Chat, YouChat, GitHub Copilot, GitLab Duo).
  • 세 가지 코딩 관련 사용 사례를 정의한다: Java에서 다중 스레딩을 사용하는 행렬 곱셈, Python의 데이터 분석, R의 데이터 시각화.
  • 각 사용 사례당 두 가지 프롬프트 변형을 사용하고, 정확성, 효율성, 이해 용이성 등 평가 기준에 따라 산출물을 평가한다(평가 루브릭 사용).
  • 비결정성에 대응하기 위해 다중 실행을 수행하고 상호 작용 로그를 포함한 재현 패키지를 제공한다.

실험 결과

연구 질문

  • RQ1현행 LLM 도구가 일반적인 과학 프로그래밍 작업에 대해 정확하고 효율적인 코드를 얼마나 잘 생성하는가?
  • RQ2LLMs가 인간의 개입 없이 과학적 워크플로에서 데이터 분석 및 데이터 시각화 작업을 얼마나 지원할 수 있는가?
  • RQ3이 사용 사례들에 대해 도구들 간의 코드 품질, 문서화 및 사용자 경험의 질적 차이는 무엇인가?
  • RQ4LLMs를 과학 코딩 작업에 적용할 때 나타나는 위험(예: 허구화, 데이터 형식 불일치)은 무엇인가?
  • RQ5동일 작업에서 도구 타입(GPT 기반, PaLM 기반, Claude 기반)에 따라 결과가 어떻게 다른가?

주요 결과

  • 대부분의 도구가 행렬 곱셈에 대한 실행 가능한 코드를 첫 시도에 생성했으며, Google Bard는 인간의 개입이 필요했고 GitLab Duo는 한정된 단일 스레드 출력만 제공했다.
  • 데이터 분석 및 시각화 작업에서 상당한 변동성이 확인되었고, GPT-4는 일반적으로 더 적은 개입을 필요로 하고 더 정확한 분석 및 그래프를 생성했으며, Bing Chat 및 Google Bard는 종종 오해의 소지가 있는 결과를 생성했다.
  • 비결정성과 데이터 형식 의존성이 주요 과제로 나타났고, 일부 도구는 데이터 구조를 처리하지 못하거나 사후 수정이 필요했다.
  • 이해 용이성과 문서화 품질이 다양했고, 일부 도구는 유용한 주석과 문서를 제공했지만, 다른 도구는 간결하거나 문서화되지 않은 코드를 생성했다.
  • GPT-4.0은 데이터 분석 및 시각화 작업 전반에서 가장 우수한 성능을 보였으며, 코드 실행 및 시각화 품질에서 두드러진 강점을 보였다. 다른 도구들은 정확도 및 시각화 정렬성에서 문제를 보였다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.