[논문 리뷰] Evaluating AI and Human Authorship Quality in Academic Writing through Physics Essays
이 연구는 300편의 짧은 물리학 에세이(인간과 GPT-4가 각각 150편씩 생성)를 익명 평가를 통해 평가하였으며, 품질에 유의미한 차이가 없음을 발견하였다(p = 0.107). 인간 평가자의 정확도는 우연을 약간 넘어서는 정도였지만, ZeroGPT는 AI 텍스트 탐지에 98%의 정확도를 기록하였다. 저자들은 학술적 정직성을 유지하면서 AI 통합을 고려할 때, 인간이 작성한 것으로 분류하기 위한 실용적인 기준으로 50% 이내의 AI 콘텐츠 비율을 제안한다.
This study evaluates $n = 300$ short-form physics essay submissions, equally divided between student work submitted before the introduction of ChatGPT and those generated by OpenAI's GPT-4. In blinded evaluations conducted by five independent markers who were unaware of the origin of the essays, we observed no statistically significant differences in scores between essays authored by humans and those produced by AI (p-value $= 0.107$, $α$ = 0.05). Additionally, when the markers subsequently attempted to identify the authorship of the essays on a 4-point Likert scale - from `Definitely AI' to `Definitely Human' - their performance was only marginally better than random chance. This outcome not only underscores the convergence of AI and human authorship quality but also highlights the difficulty of discerning AI-generated content solely through human judgment. Furthermore, the effectiveness of five commercially available software tools for identifying essay authorship was evaluated. Among these, ZeroGPT was the most accurate, achieving a 98% accuracy rate and a precision score of 1.0 when its classifications were reduced to binary outcomes. This result is a source of potential optimism for maintaining assessment integrity. Finally, we propose that texts with $\leq 50\%$ AI-generated content should be considered the upper limit for classification as human-authored, a boundary inclusive of a future with ubiquitous AI assistance whilst also respecting human-authorship.
연구 동기 및 목표
- AI로 생성된 에세이가 물리학 맥락에서 인간이 작성한 에세이의 품질과 동일한지 평가하는 것.
- 인간 평가자가 학술적 글쓰기에서 AI와 인간의 저자성을 구분할 수 있는지 평가하는 것.
- 상용 AI 탐지 도구가 학술적 에세이 내 AI 생성 콘텐츠를 식별하는 데 얼마나 효과적인지 테스트하는 것.
- 인간이 작성한 학술적 작업에서 허용 가능한 AI 콘텐츠 비율의 실용적 기준을 설정하는 것.
- 학술적 정직성을 유지하면서 높은 교육 수준에서 AI 사용에 대한 정책을 안내하는 것.
제안 방법
- 저자성 여부를 모른 채 5명의 독립 평가자가 300편의 짧은 물리학 에세이(인간 150편, GPT-4 생성 150편)를 익명 평가함.
- 에세이는 물리학 수업의 형성적 평가 및 종합 평가에서 유래되었으며, 주제는 물리학의 역사, 철학, 윤리학에 해당함.
- 평가자는 표준화된 기준에 따라 학술적 품질을 평가하였고, 편향을 방지하기 위해 저자성 여부는 평가 후에 할당함.
- 후속 작업으로 평가자들은 각 에세이를 '확실히 AI', '다소 AI', '다소 인간', '확실히 인간'의 4점 척도로 분류하도록 요청받음.
- ZeroGPT 포함 5종의 상용 AI 탐지 도구가 AI 생성 콘텐츠 식별 정확도를 평가함.
- 인간이 작성한 것으로 분류하기 위한 실용적 기준으로 ≤50%의 AI 생성 콘텐츠 비율을 제안함.
실험 결과
연구 질문
- RQ1AI로 생성된 물리학 에세이와 인간이 작성한 에세이 간에 통계적으로 유의미한 품질 차이가 있는가?
- RQ2익명 평가 환경에서 인간 평가자가 AI와 인간 저자성의 학술적 에세이를 신뢰성 있게 구분할 수 있는가?
- RQ3상용으로 제공되는 AI 탐지 도구가 학술적 콘텐츠 내 AI 생성 콘텐츠를 식별하는 데 얼마나 효과적인가?
- RQ4인간이 작성한 학술적 작업에서 저자성의 정당성을 훼손하지 않으면서 허용 가능한 AI 생성 콘텐츠 비율은 어느 정도인가?
- RQ5높은 교육 수준에서 AI 보조와 학술적 정직성을 균형 있게 유지하기 위한 정책 가이드라인은 무엇인가?
주요 결과
- 인간과 AI 생성 에세이 간의 품질에 통계적으로 유의미한 차이가 없음을 발견함(p = 0.107, α = 0.05).
- 인간 평가자의 AI 저자성 식별 능력은 우연보다 약간 높을 뿐, 50%를 크게 초과하지는 않았음.
- ZeroGPT는 이진 분류로 줄였을 때 AI 생성 콘텐츠 탐지에 98% 정확도와 1.0 정밀도를 기록함.
- 연구 결과, AI 생성 에세이는 철학적 및 역사적 물리학 주제 전반에 걸쳐 내용, 구성, 학술적 엄밀성 면에서 인간 기준에 도달함을 확인함.
- 상용 복제 방지 도구는 탐지 회피에 효과적이지 않아, 인간의 편집이 AI 탐지 시스템을 우회하기 위해 필수적임을 시사함.
- 저자들은 AI 생성 콘텐츠 비율이 ≤50%인 작업은 인간이 작성한 것으로 분류할 것을 제안하며, 향후 학술 작업에 실용적이고 포용적인 기준을 제시함.
더 나은 연구,지금 바로 시작하세요
논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.
카드 등록 없음 · 무료 플랜 제공
이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.