Skip to main content
QUICK REVIEW

[논문 리뷰] Creating Large Language Model Resistant Exams: Guidelines and Strategies

Simon kaare Larsen|arXiv (Cornell University)|2023. 04. 18.
Artificial Intelligence in Healthcare and EducationMedicine인용 수 3
한 줄 요약

이 논문은 실제 세계의 시나리오, 의도적인 오류, 비텍스트 콘텐츠, 그리고 소프트 스킬 평가를 활용하여 대규모 언어 모델(Large Language Model, LLM)에 저항하는 시험을 설계하기 위한 실용적인 지침을 제안한다. 전략적 설계를 통해 시험은 LLM 도용을 방지하면서도 학술적 정당성과 현대 직업 환경과의 관련성을 유지할 수 있음을 입증한다.

ABSTRACT

The proliferation of Large Language Models (LLMs), such as ChatGPT, has raised concerns about their potential impact on academic integrity, prompting the need for LLM-resistant exam designs. This article investigates the performance of LLMs on exams and their implications for assessment, focusing on ChatGPT's abilities and limitations. We propose guidelines for creating LLM-resistant exams, including content moderation, deliberate inaccuracies, real-world scenarios beyond the model's knowledge base, effective distractor options, evaluating soft skills, and incorporating non-textual information. The article also highlights the significance of adapting assessments to modern tools and promoting essential skills development in students. By adopting these strategies, educators can maintain academic integrity while ensuring that assessments accurately reflect contemporary professional settings and address the challenges and opportunities posed by artificial intelligence in education.

연구 동기 및 목표

  • 학생 평가에서 ChatGPT와 같은 대규모 언어 모델(LLM)의 사용으로 인한 학술적 정당성에 대한 우려가 증가하고 있는 데 대응하기 위해.
  • 특히 ChatGPT에 초점을 맞춰, LLM이 시험 문제에 어떻게 대답하는지의 능력과 한계를 조사하기 위해.
  • 교육자들이 LLM에 의해 생성된 답변에 저항하는 실천 가능하고 근거 기반의 지침을 개발하기 위해.
  • 평가가 실제 세계의 전문 역량을 반영하고 학생들의 필수 역량 개발을 촉진하기 위해.
  • 교육 평가 방식을 교육 분야에서의 인공지능 도구의 변화하는 환경에 맞게 적응시키기 위해.

제안 방법

  • LLM의 학습 데이터를 초월하는 실제 세계의 시나리오를 통합하여, LLM이 설득력 있는 잘못된 답변을 생성할 수 있는 능력을 감소시킨다.
  • 시험 문제에 의도적인 오류를 도입하여 학생들이 오락실 정보를 탐지하고 수정할 수 있는 능력을 시험한다. 이 능력은 LLM이 자주 인식하지 못하는 영역이다.
  • LLM이 정확하게 해석할 수 없는 다이어그램, 차트 또는 이미지와 같은 비텍스트 정보를 사용하여 자동화된 도용의 난이도를 높인다.
  • 비판적 사고, 윤리적 추론, 맥락 판단과 같은 소프트 스킬 평가를 요구하는 질문을 설계하여, LLM이 뒤처지는 분야를 강조한다.
  • 다중 선택 문제에서 효과적인 오답 선택지를 구현하여 LLM의 추론 능력을 시험하고 무작위로 정답을 맞출 가능성을 줄인다.
  • 기억을 중심으로 하는 평가에서 응용 중심으로의 전환을 유도하여, 개인적 반성이나 상황 적응이 필요한 과제를 우선시한다.

실험 결과

연구 질문

  • RQ1ChatGPT와 같은 대규모 언어 모델은 기존의 시험 형식에서 어떻게 성과를 내며, 어디서 취약성을 드러내는가?
  • RQ2어떤 특정한 설계 요소가 LLM 기반 도용에 성공할 가능성을 줄일 수 있는가?
  • RQ3어떻게 평가를 재구성하여 LLM이 재현할 수 없는 인간의 역량을 우선시할 수 있는가?
  • RQ4교육자들은 어떻게 실제 세계의 맥락 기반 시나리오를 통합하여 LLM의 효과를 제한할 수 있는가?
  • RQ5비텍스트 요소와 의도적인 오류는 LLM에 저항하는 시험 설계에서 어떤 역할을 하는가?

주요 결과

  • ChatGPT와 같은 LLM은 내용이 모호하거나 실제 세계의 맥락이 부족한 표준 시험 문제에서 설득력 있는 잘못된 답변을 생성할 수 있다.
  • 질문에 의도적인 오류를 포함시키면 LLM이 잘못된 정보를 탐지하고 수정하지 못하는 능력이 드러나며, 이는 정답을 올바르게 답변할 확률을 감소시킨다.
  • 다이어그램이나 차트와 같은 비텍스트 콘텐츠를 포함한 시험은 LLM이 시각적 데이터를 신뢰성 있게 해석할 수 없기 때문에, LLM 기반 도용의 위험을 크게 줄인다.
  • 윤리적 판단과 비판적 사고와 같은 소프트 스킬을 강조하는 평가는 LLM이 생성한 답변에 덜 취약하며, 이는 인간 수준의 추론이 필요하기 때문이다.
  • 상황 적응이 필요한 실제 세계의 시나리오 기반 질문은 LLM이 훈련 데이터에 의존하기 때문에 정답을 올바르게 답할 가능성이 낮다.
  • 제안된 지침들은 기억을 중심으로 하는 평가에서 적용, 판단, 맥락 이해 중심으로의 평가로의 전환을 통해 종합적으로 시험의 정당성을 향상시킨다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.