Skip to main content
QUICK REVIEW

[논문 리뷰] Lost at C: A User Study on the Security Implications of Large Language Model Code Assistants

Gustavo Sandoval, Hammond Pearce|arXiv (Cornell University)|2022. 08. 20.
Software Engineering Research인용 수 39
한 줄 요약

이 논문은 Codex 기반 AI 코드 제안이 학생들이 C 단일 연결 쇼핑 목록을 구현할 때 보안 버그를 증가시키는지 여부를 평가하기 위한 보안 중심 사용자 연구(N=58)를 수행한다; 결과는 보안 영향이 작고 AI 지원 코드의 버그가 대조군보다 10%를 초과하지 않는다는 것을 보여준다.

ABSTRACT

Large Language Models (LLMs) such as OpenAI Codex are increasingly being used as AI-based coding assistants. Understanding the impact of these tools on developers' code is paramount, especially as recent work showed that LLMs may suggest cybersecurity vulnerabilities. We conduct a security-driven user study (N=58) to assess code written by student programmers when assisted by LLMs. Given the potential severity of low-level bugs as well as their relative frequency in real-world projects, we tasked participants with implementing a singly-linked 'shopping list' structure in C. Our results indicate that the security impact in this setting (low-level C with pointer and array manipulations) is small: AI-assisted users produce critical security bugs at a rate no greater than 10% more than the control, indicating the use of LLMs does not introduce new security risks.

연구 동기 및 목표

  • 실제와 유사한 코드 작성 task에서 AI 코드 어시스턴트가 보안에 영향을 미치는지 평가하여 연구를 동기화한다.
  • AI 지원 코드와 비지원 코드의 보안 버그 발생율을 비교한다.
  • AI 지원 코딩 작업에서 보안 버그가 어디에서 어떻게 기원하는지(사람 대 AI의 기여를 포함) 분석한다.
  • 재현성과 더 넓은 분석을 위한 오픈 데이터 제공한다.

제안 방법

  • Codex 접근이 없는 대조군과 Codex 접근이 있는 보조군의 무작위 배정된 대조 설계.
  • 클라우드 기반 IDE가 Codex와의 상호 작용을 로그하여 AI 제안 채택 여부를 분석한다.
  • 메모리 관련 버그를 스트레스하기 위해 단일 연결 쇼핑 목록의 12개 C 함수 작성.
  • CWE 분류 체계를 사용한 보안 및 기능 평가와 정적/실행 시 분석 및 수동 검토를 수행한다.
  • Autopilot 조건은 비교를 위해 Codex가 전체 코드를 생성하는 설정으로(세 Codex 모델에서 30개 솔루션) 수행한다.
  • 통계적 프레임워크에는 효율성에 대한 비교 검정 및 10% 취약성 한계의 비열등성 검정이 포함된다.

실험 결과

연구 질문

  • RQ1RQ1: AI 코드 어시스턴트가 초보 사용자가 더 나은 기능 코드를 작성하는 데 도움이 되는가?
  • RQ2RQ2: AI 지원 솔루션의 보안 버그 발생률이 비지원 코드에 비해 허용 가능한가?
  • RQ3RQ3: LLM-지원 시스템에서 버그는 어디에서 기인하는가(사람이 작성한 코드 대 AI가 제안한 코드)?

주요 결과

  • AI 지원 사용자는 기능 코드를 생산하며 생산성 이점이 이전 연구와 일치한다.
  • AI 지원 그룹의 보안 버그는 대조군의 код당 incidence가 10% 이상 높은 것이 아니었다.
  • 버그의 63%는 사람이 작성한 코드에서 기원했고 36%는 AI가 제안한 코드에서 존재했다.
  • 연구는 CWE 분류 체계를 사용하여 버그를 분류하고 수동 분석과 정적/런타임 검사를 결합했다.
  • 연구의 데이터와 자료는 오픈 소스로 제공된다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.