Skip to main content
QUICK REVIEW

[논문 리뷰] Assessing AI Detectors in Identifying AI-Generated Code: Implications for Education

Wei Pan, Ming Jie Chok|arXiv (Cornell University)|2024. 01. 08.
Artificial Intelligence in Healthcare and Education인용 수 6
한 줄 요약

이 논문은 다섯 가지 AI생성 콘텐츠(AIGC) 탐지기를 13개의 프롬프트 변형에서 AI생성 Python 코드에 대해 실증적으로 평가하고, 5,069개의 샘플 데이터세트를 사용하며, 인간이 작성한 코드와 AI생성 코드 구분에 탐지기가 제대로 작동하지 못하고 코드 변형에 민감하다는 것을 발견합니다.

ABSTRACT

Educators are increasingly concerned about the usage of Large Language Models (LLMs) such as ChatGPT in programming education, particularly regarding the potential exploitation of imperfections in Artificial Intelligence Generated Content (AIGC) Detectors for academic misconduct. In this paper, we present an empirical study where the LLM is examined for its attempts to bypass detection by AIGC Detectors. This is achieved by generating code in response to a given question using different variants. We collected a dataset comprising 5,069 samples, with each sample consisting of a textual description of a coding problem and its corresponding human-written Python solution codes. These samples were obtained from various sources, including 80 from Quescol, 3,264 from Kaggle, and 1,725 from LeetCode. From the dataset, we created 13 sets of code problem variant prompts, which were used to instruct ChatGPT to generate the outputs. Subsequently, we assessed the performance of five AIGC detectors. Our results demonstrate that existing AIGC Detectors perform poorly in distinguishing between human-written code and AI-generated code.

연구 동기 및 목표

  • 프로그래밍 과제에서 기존 AIGC 탐지기가 AI생성 코드를 얼마나 잘 식별하는지 평가한다.
  • 다양한 코드 및 프롬프트 변형 하에서 탐지기의 한계를 조사한다.
  • 교육적 진실성 실천 및 탐지기 사용에 정보를 제공하기 위한 실증 데이터를 제공한다.

제안 방법

  • Quescol, Kaggle, LeetCode로부터 문제 설명과 인간이 작성한 Python 해답으로 구성된 5,069개 샘플 데이터셋을 수집한다.
  • 다양한 프롬프트를 사용해 ChatGPT에 프롬프트 변형을 주어 13개의 AI생성 코드 변형을 만든다.
  • 다섯 개의 AIGC 탐지기를 적용해 0.5 임계값으로 코드를 인간-생성/AI생성으로 분류한다.
  • 모든 변형에 대해 정확도, 정밀도, TPR, FPR, TNR, FNR를 사용해 탐지기를 평가한다.
  • 복제 패키지를 제공하고 재현 가능성을 위해 워크플로를 알고리즘적 단계로 문서화한다.

실험 결과

연구 질문

  • RQ1RQ1: 기존 AIGC 탐지기가 AI생성 코드를 탐지하는 데 얼마나 정확한가?
  • RQ2RQ2: AI생성 코드를 탐지하는 데 있어 기존 AIGC 탐지기의 한계는 무엇인가.

주요 결과

  • 다섯 가지 탐지기 모두 인간이 작성한 코드와 AI생성 코드를 구분하는 데 정확도가 낮게 나타남 (ACC가 여러 탐지기에서 약 0.5 근처).
  • GLTR은 변형에 대해 상당한 민감도를 보이며, ACC가 변형 전반에 걸쳐 0.4841에서 0.7693 사이로 나타난다.
  • DetectGPT는 일부 기준선에 비해 TNR을 5~9个百分点 향상시키지만 전반적으로 한계가 남아 있다.
  • Sapling은 많은 변형에서 ACC가 지속적으로 0.6 이상을 기록하며 특정 변형에 대해 상대적으로 강건함을 보인다.
  • GPTZero와 GPT-2 Detector는 대체로 기준선 성능 근처를 맴돌며 많은 변형에서 낮은 TNR을 보인다.
  • 변형으로 인한 변화(예: 불용어 제거, 명명 변경, 죽은 코드 포함)가 탐지기 성능에 상당한 영향을 줄 수 있다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.