Skip to main content
QUICK REVIEW

[논문 리뷰] Watching the watchers: bias and vulnerability in remote proctoring software

Ben Burgess, Avi Ginsberg|arXiv (Cornell University)|2022. 05. 06.
Artificial Intelligence in Healthcare and Education인용 수 14
한 줄 요약

이 논문은 미국 법학과 및 주 변호사 자격시험에서 사용되는 네 가지 주요 원격 감독 소프트웨어 패키지를 처음으로 기술적으로 역공학적으로 분석하여, 그들의 방作弊 조치가 간단한 기술로 쉽게 우회될 수 있고, 얼굴 인식 시스템이 인종적 편향을 보이며 더 어두운 피부색을 가진 사람들을 비례적으로 더 자주 오류 경고로 표시한다는 것을 드러냈다. 연구는 이러한 시스템이 지속적인 특권 접근과 감시로 인해 심각한 개인정보 위험을 초래하며, 얼굴 인식 대신 인간 검토와 다른 평가 방법으로 전환할 것을 권고한다.

ABSTRACT

Educators are rapidly switching to remote proctoring and examination software for their testing needs, both due to the COVID-19 pandemic and the expanding virtualization of the education sector. State boards are increasingly utilizing these software for high stakes legal and medical licensing exams. Three key concerns arise with the use of these complex software: exam integrity, exam procedural fairness, and exam-taker security and privacy. We conduct the first technical analysis of each of these concerns through a case study of four primary proctoring suites used in U.S. law school and state attorney licensing exams. We reverse engineer these proctoring suites and find that despite promises of high-security, all their anti-cheating measures can be trivially bypassed and can pose significant user security risks. We evaluate current facial recognition classifiers alongside the classifier used by Examplify, the legal exam proctoring suite with the largest market share, to ascertain their accuracy and determine whether faces with certain skin tones are more readily flagged for cheating. Finally, we offer recommendations to improve the integrity and fairness of the remotely proctored exam experience.

연구 동기 및 목표

  • 고위험 법학 및 의료 자격시험에서 사용되는 원격 감독 소프트웨어의 기술적 보안 및 개인정보 위험을 조사하기 위해.
  • 특히 다양한 피부색 간에 차이가 나는 얼굴 인식 분류기의 공정성과 정확도를 평가하기 위해.
  • 기관의 압박과 대안 부족으로 학생들이 실제로 침투적인 감시에 의미 있는 동의를 할 수 있는지 평가하기 위해.
  • 시험의 무결성과 절차적 공정성을 해치는 프로ctor링 소프트웨어의 체계적 취약점을 평가하기 위해.
  • 교육자, 기관, 공급업체가 원격 감독의 보안, 개인정보 보호, 공정성을 향상시키기 위해 실천 가능한 권고안을 제공하기 위해.

제안 방법

  • 정적 및 동적 분석 기법을 사용하여 Examplify, ILG Exam360, Exam4, Electronic Blue Book 등 네 가지 주요 프로코어팅 패키지를 역공학적으로 분석하였다.
  • Examplify에서 사용하는 얼굴 인식 모델을 추출하고 분석하여, 공개적으로 이용 가능한 사전 학습 모델이 포함된 'face-api.js'로 확인하였다.
  • 성능과 편향을 평가하기 위해 다양한 데이터셋에서 최신 기술 수준의 분류기와 비교하여 이들 얼굴 인식 모델의 정확도를 평가하였다.
  • 동의, 감시 범위, 데이터 전송 방식을 평가하기 위해 이용 약관, 사용자 인터페이스, 시스템 로그를 수집하고 분석하였다.
  • 다양한 수준의 공격자(일반 학생, 컴퓨터 과학 학생, 역공학 전문가)가 보안 제어를 우회할 수 있는지의 가능성을 평가하기 위해 위협 모델링을 수행하였다.
  • 시험 후에도 지속되는 특권을 가진 시스템 서비스의 존재를 매핑하고 장기적인 개인정보 위험을 분석하였다.

실험 결과

연구 질문

  • RQ1일반적으로 사용되는 원격 감독 소프트웨어 패키지의 방作弊 조치가 낮은 기술 수준으로도 우회 가능한가?
  • RQ2원격 감독 소프트웨어에서 사용하는 얼굴 인식 시스템이 잘못된 경고 발생률 측면에서 인종적 편향을 얼마나 보이는가?
  • RQ3원격 감독 소프트웨어의 개인정보 및 보안 관행이 정보 기반 동의와 사용자 자율성에 어떻게 악영향을 미치는가?
  • RQ4시험 후에도 학생 기기 내에 지속적으로 설치된 특권 소프트웨어의 장기적 위험은 무엇인가?
  • RQ5원격 감독의 공정성, 무결성, 개인정보 보호를 향상시키기 위해 어떤 기술적 및 정책적 변화가 가능한가?

주요 결과

  • 분석한 네 가지 프로코어팅 패키지 모두 시험 후에도 지속되는 매우 높은 특권을 가진 시스템 서비스를 설치하며, 이는 사용자의 모든 활동(시험 이전에 생성된 로그 포함)에 접근할 수 있다.
  • Examplify에서 사용하는 얼굴 인식 시스템인 'face-api.js'는 인종 그룹 간 정확도 격차가 뚜렷하게 나타나며, 더 어두운 피부색을 가진 개인이 도용으로 오해당할 가능성이 더 높다.
  • 높은 보안을 주장하지만, 모든 방作弊 조치는 숙련된 공격자에 의해 간단하게 우회 가능하므로 위협 모델에 근본적인 결함이 있음을 시사한다.
  • 시험 중에 시험 이전의 시스템 로그가 공급업체 서버로 전송되며, 최소한의 데이터 수집 원칙을 위반한다.
  • 소프트웨어의 디버깅 방지 및 오브스큐레이션 기법은 독립적인 보안 분석을 어렵게 하여 투명성과 사용자 신뢰를 떨어뜨린다.
  • 현재 얼굴 인식 모델이 다각도의 집단의 참여 없이 현저한 재설계 없이도 인종적 편향을 제거할 수 있다는 증거는 발견되지 않았다.

더 나은 연구,지금 바로 시작하세요

논문 읽기부터 검토까지, 연구 시간을 획기적으로 줄여보세요.

카드 등록 없음 · 무료 플랜 제공

이 리뷰는 AI가 만들고, 인간 에디터가 검토했습니다.