Skip to main content
QUICK REVIEW

[논문 리뷰] Beyond Black Box AI-Generated Plagiarism Detection: From Sentence to Document Level

Mujahid Quidwai, Chunhui Li|arXiv (Cornell University)|2023. 06. 13.
Topic Modeling인용 수 5
한 줄 요약

이 논문은 대량의 언어 모델(Large Language Models, LLMs)의 보급으로 인해 증가하는 학술 분야에서의 AI 생성 텍스트 위작 문제를 해결하기 위해, 복수의 재구성된 질문을 생성하고, 학생의 응답과 LLM이 생성한 답변 간 문장 수준의 임베딩을 비교함으로써 AI 생성 텍스트를 탐지하는 투명하고 자연어처리(NLP) 기반의 방법을 제안한다. 대비 손실(contrastive loss)을 기반으로 한 이 접근법은 인간 대비 AI 텍스트 분류에서 94%의 정확도를 달성하며, 문장 수준에서 설명 가능하고 정량화된 지표를 제공함으로써 오진률을 낮추고 기존 도구의 투명하지 못한 성질을 제거한다.

ABSTRACT

The increasing reliance on large language models (LLMs) in academic writing has led to a rise in plagiarism. Existing AI-generated text classifiers have limited accuracy and often produce false positives. We propose a novel approach using natural language processing (NLP) techniques, offering quantifiable metrics at both sentence and document levels for easier interpretation by human evaluators. Our method employs a multi-faceted approach, generating multiple paraphrased versions of a given question and inputting them into the LLM to generate answers. By using a contrastive loss function based on cosine similarity, we match generated sentences with those from the student's response. Our approach achieves up to 94% accuracy in classifying human and AI text, providing a robust and adaptable solution for plagiarism detection in academic settings. This method improves with LLM advancements, reducing the need for new model training or reconfiguration, and offers a more transparent way of evaluating and detecting AI-generated text.

연구 동기 및 목표

  • 대규모 언어 모델(Large Language Models, LLMs)의 보급으로 인한 학술 환경에서의 AI 생성 표절 문제를 해결하기 위해.
  • 기존 AI 텍스트 탐지 도구의 한계, 즉 높은 오진률, 투명하지 못한 의사결정 과정, 해석 불가능성 문제를 해결하기 위해.
  • 인간 평가자가 탐지 결과를 이해하고 검증할 수 있도록 정량적이고 문장 수준의 메트릭을 제공하는 방법을 개발하기 위해.
  • 모델의 진화에 따라 재학습이나 재구성 없이도 효과성을 유지할 수 있는 탐지 시스템을 구축하기 위해.

제안 방법

  • 최신 기술의 재구성 모델을 사용하여 주어진 입력 질문의 여러 문장 수준의 재구성된 버전을 생성한다.
  • 각 재구성된 질문을 대규모 언어 모델(LLM)에 입력하여 해당하는 답변을 생성함으로써 다양한 기준 응답을 확보한다.
  • 미리 훈련된 임베딩 모델을 사용하여 학생의 응답과 LLM이 생성한 답변에서 문장 임베딩을 추출한다.
  • 코사인 유사도를 기반으로 한 대비 손실 함수를 적용하여 학생 응답과 LLM 응답 간 대응하는 문장 간 매칭을 수행함으로써 세밀한 비교를 가능하게 한다.
  • 모델은 문장 수준에서 유사도 점수를 계산하여 AI 생성 콘텐츠의 투명하고 해석 가능한 탐지를 가능하게 한다.
  • 모델의 진화에 따라도 재학습 없이도 다양한 LLMs, 예를 들어 GPT-3.5, BardAI, Character.AI 등에 적용 가능한 유연성을 확보한다.

실험 결과

연구 질문

  • RQ1학생의 응답과 LLM이 생성한 답변 간 문장 수준의 임베딩 비교는 AI 생성 텍스트 탐지의 정확도와 투명도를 향상시킬 수 있는가?
  • RQ2재구성된 프롬프트의 사용은 다양한 입력 변형에 대해 AI 텍스트 탐지의 강건성과 일반화 능력을 어떻게 향상시키는가?
  • RQ3코사인 유사도를 기반으로 한 대비 학습은 인간의 글씨체를 모방하는 미세한 AI 생성 콘텐츠를 얼마나 잘 탐지할 수 있는가?
  • RQ4재학습 없이도 다양한 LLMs에서 높은 성능을 유지할 수 있는가? 이는 모델의 진화에 따라 장기적인 관련성을 확보하는 데 기여하는가?
  • RQ5유사도 점수의 문장 수준에서의 설명 가능성은 오진률을 어떻게 감소시키며, 학술 표절 평가에서 인간 평가자를 어떻게 지원하는가?

주요 결과

  • 제안된 방법은 HC3 데이터셋에서 인간 생성 응답과 AI 생성 응답을 구분하는 데 94%의 정확도를 달성한다.
  • 코사인 유사도를 기반으로 한 문맥 임베딩의 유사도 점수에서 유래된 문장 수준의 유사도 지표는 인간 평가자가 이해하고 검증할 수 있는 정량적이고 해석 가능한 메트릭을 제공한다.
  • 모델 예측의 투명하지 못한 성질에 의존하는 것 대신, 세밀하고 근거 기반의 비교를 가능하게 하여 오진률을 크게 감소시킨다.
  • GPT-3.5 및 최신 모델을 포함한 다양한 LLMs에서 재학습이나 재구성 없이도 효과성을 유지한다.
  • 재구성된 프롬프트의 사용은 기준 응답의 다양성을 증가시켜 학생의 글쓰기 변형에 대비한 탐지의 강건성을 향상시킨다.
  • 기존 탐지 도구의 투명하지 못한 성질을 제거하기 위해, 기반의 문장 수준 비교와 유사도 점수를 폭 드러내는 방식으로, 이 방법은 투명한 탐지 메커니즘을 제공한다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.