[논문 리뷰] Classification of Human- and AI-Generated Texts: Investigating Features for ChatGPT
이 논문은 전통적이고 새로운 특징들을 포함한 다양한 특징들(예: 퍼플렉서티, 의미 유사도, 목록 검색, 오류 기반 지표, 독해력, AI 피드백, 텍스트 벡터 등)을 사용하여 인간이 작성한 텍스트와 AI가 생성한 텍스트를 식별하는 새로운 분류 프레임워크를 제안한다. 최고의 시스템은 고급 AI 생성 텍스트에 대해 F1 스코어 96.9%를 기록했으며, AI 재구성 텍스트에 대해서는 81.7%를 기록했고, 이는 GPTZero 대비 기본 재구성 탐지에서 F1 스코어 기준 183.8% 향상된 성능이다.
Recently, generative AIs like ChatGPT have become available to the wide public. These tools can for instance be used by students to generate essays or whole theses. But how does a teacher know whether a text is written by a student or an AI? In our work, we explore traditional and new features to (1) detect text generated by AI from scratch and (2) text rephrased by AI. Since we found that classification is more difficult when the AI has been instructed to create the text in a way that a human would not recognize that it was generated by an AI, we also investigate this more advanced case. For our experiments, we produced a new text corpus covering 10 school topics. Our best systems to classify basic and advanced human-generated/AI-generated texts have F1-scores of over 96%. Our best systems for classifying basic and advanced human-generated/AI-rephrased texts have F1-scores of more than 78%. The systems use a combination of perplexity, semantic, list lookup, error-based, readability, AI feedback, and text vector features. Our results show that the new features substantially help to improve the performance of many classifiers. Our best basic text rephrasing detection system even outperforms GPTZero by 183.8% relative in F1-score.
연구 동기 및 목표
- 교육 현장에서 증가하는 AI 생성 및 AI 재구성 학생 텍스트 탐지 문제를 해결하기 위해.
- 기존의 퍼플렉서티와 버스트니스 외에 새로운 특징들인 목록 검색, 오류 기반 지표, AI 피드백 등의 효과를 조사하기 위해.
- 기본 및 고급 AI 텍스트 생성 및 재구성에 모두 적용 가능한 강력하고 일반화 가능한 탐지 시스템을 개발하고 평가하기 위해.
- 미래의 AI 텍스트 탐지 연구를 위한 공개 가능하고 고품질의 코퍼스를 제공하기 위해.
- 기존 도구인 GPTZero와의 성능 비교를 통해 뛰어난 탐지 정확도를 입증하기 위해.
제안 방법
- 저자들은 10개의 학교 주제에 걸쳐 총 500개의 기사로 구성된 새로운 공개 코퍼스를 구축하였으며, 이는 인간이 작성한 것인지 또는 AI가 생성한 것인지, 재구성된 것인지 레이블링되었다.
- 퍼플렉서티, 의미 유사도, 목록 검색(제목 반복 포함), 오류 기반 지표(예: 문법 오류), 독해력 점수, AI 피드백 신호, 텍스트 벡터 표현 등 포괄적인 특징 세트를 설계하였다.
- 여러 분류기(XGBoost, 랜덤 포레스트, 다층 퍼셉트론)를 다양한 특징 조합에 대해 훈련하고 평가하였다.
- 기존의 특징과 새로운로 도입된 특징을 포함한 특징 세트를 체계적으로 비교하여 각 특징의 탐지 성능에 미치는 영향을 분석하였다.
- 정확도와 F1 스코어를 성능 측정 지표로 사용하였으며, 기준선으로 GPTZero를 대비하여 비교하였다.
- 최고의 성능을 보인 모델은 모든 특징 유형을 조합하여, 특징의 다양성이 탐지의 강건성 향상에 기여함을 입증하였다.

실험 결과
연구 질문
- RQ1고급 프롬프팅 전략을 적용한 상황에서도 기존 특징과 새로운 특징이 인간이 작성한 텍스트와 AI가 생성한 텍스트를 구분하는 데 얼마나 효과적인가?
- RQ2목록 검색, 오류 기반 지표, AI 피드백 등의 특징이 퍼플렉서티와 버스트니스와 같은 표준 지표를 넘어서 탐지 성능을 얼마나 향상시키는가?
- RQ3기존 도구인 GPTZero를 능가할 수 있는 탐지 시스템은 특히 AI 재구성 텍스트 탐지에서 성능을 뛰어나게 할 수 있는가?
- RQ4기본적이고 고급적인 텍스트 생성 및 재구성 시나리오 간 탐지 모델의 성능은 어떻게 달라지는가?
- RQ5각 특징 유형이 전체 분류 성능에 기여하는 비율은 어느 정도인가?
주요 결과
- 고급 AI 생성 텍스트 탐지에 최고의 시스템이 F1 스코어 96.9%를 기록하여 복잡한 AI 출력을 신뢰성 있게 식별함을 입증하였다.
- AI 재구성 텍스트에 대해서는 최고의 시스템이 F1 스코어 81.7%를 기록하였으며, 이는 GPTZero의 45.8% F1 스코어에 비해 뚜렷한 성능 향상이다.
- 기본 텍스트 재구성 탐지에 최고의 시스템은 GPTZero 대비 상대 F1 스코어 향상률 183.8%를 기록하였다.
- 새로운 특징, 특히 목록 검색과 AI 피드백의 포함이 모든 설정에서 탐지 성능을 크게 향상시켰다.
- 텍스트 벡터 및 문서 수준의 특징이 가장 예측력 있는 특징으로 나타났으며, 오류 기반 특징은 중간 정도이지만 일관된 성능 향상을 보였다.
- 모든 분류기에서 성능이 유사하게 유지되었으며, XGBoost, 랜덤 포레스트, MLP는 전체 특징 세트를 사용할 경우 유사한 성능을 보였다.

더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.