Skip to main content
QUICK REVIEW

[論文レビュー] Watching the watchers: bias and vulnerability in remote proctoring software

Ben Burgess, Avi Ginsberg|arXiv (Cornell University)|May 6, 2022
Artificial Intelligence in Healthcare and Education被引用数 14
ひとこと要約

本論文は、米国法科大学院および州弁護士資格試験で使用される4つの主要なリモート監視ソフトウェアの、初めての技術的逆解析を実施し、その不正防止措置が容易に回避可能であり、顔認識システムが人種的バイアスを示し、肌の色が濃い人々を特に多く誤検出していることを明らかにした。本研究は、恒久的な特権アクセスと監視が伴うため、これらのシステムが重大なプライバシーリスクをもたらすことを示し、顔認識を人間によるレビューおよび代替評価方法に置き換えるべきであると提言している。

ABSTRACT

Educators are rapidly switching to remote proctoring and examination software for their testing needs, both due to the COVID-19 pandemic and the expanding virtualization of the education sector. State boards are increasingly utilizing these software for high stakes legal and medical licensing exams. Three key concerns arise with the use of these complex software: exam integrity, exam procedural fairness, and exam-taker security and privacy. We conduct the first technical analysis of each of these concerns through a case study of four primary proctoring suites used in U.S. law school and state attorney licensing exams. We reverse engineer these proctoring suites and find that despite promises of high-security, all their anti-cheating measures can be trivially bypassed and can pose significant user security risks. We evaluate current facial recognition classifiers alongside the classifier used by Examplify, the legal exam proctoring suite with the largest market share, to ascertain their accuracy and determine whether faces with certain skin tones are more readily flagged for cheating. Finally, we offer recommendations to improve the integrity and fairness of the remotely proctored exam experience.

研究の動機と目的

  • 高利害な法的および医療資格試験で使用されるリモート監視ソフトウェアの技術的セキュリティおよびプライバシー上のリスクを調査すること。
  • 特に異なる肌の色のグループに対して顔認識分類器の公平性と正確性を評価すること。
  • 制度的圧力と代替手段の欠如がある中で、学生が監視を意味的に同意できるかどうかを評価すること。
  • 試験の完全性と手続上の公正性を損なう、プロクタリングソフトウェアにおける体系的脆弱性を同定すること。
  • 教育者、機関、ベンダーが、セキュリティ、プライバシー、公平性を向上させるための実行可能な提言を提供すること。

提案手法

  • 静的および動的解析手法を用いて、Examplify、ILG Exam360、Exam4、Electronic Blue Book の4つの主要なプロクタリング・スイートを逆解析した。
  • Examplify が使用する顔認識モデルを抽出・分析し、公開済みの事前学習済みモデルを備えた 'face-api.js' であることを同定した。
  • 性能とバイアスを評価するため、多様なデータセット上で、これらの顔認識モデルの正確性を最先端の分類器と比較した。
  • 同意、監視範囲、データ送信の実態を評価するため、利用規約、ユーザーインターフェース、システムログを収集・分析した。
  • 攻撃者のスキルレベル(一般学生、CS専攻学生、逆解析者)に応じて、セキュリティ制御を回避可能かどうかを評価するための脅威モデルを構築した。
  • 試験終了後の特権的システムサービスの持続性をマッピングし、長期的なプライバシーリスクを分析した。

実験結果

リサーチクエスチョン

  • RQ1広く使用されているリモート監視ソフトウェアの不正防止機構は、低い技術的スキルで回避可能か?
  • RQ2プロクタリングソフトウェアで使用される顔認識システムは、誤検出率において人種的バイアスをどの程度示しているか?
  • RQ3プロクタリングソフトウェアのプライバシーおよびセキュリティ実務は、情報に基づいた同意とユーザーの自律性をどの程度損なっているか?
  • RQ4試験後も学生のデバイスに恒久的にインストールされた特権ソフトウェアがもたらす長期的リスクは何か?
  • RQ5公平性、完全性、プライバシーを向上させるために、技術的および政策的変更はどのようなものか?

主な発見

  • 分析した4つのプロクタリングスイートすべてが、試験終了後も残存する高度に特権的なシステムサービスをインストールしており、それらは試験前からユーザーのすべての活動(ログを含む)にアクセス可能である。
  • Examplify が使用する顔認識システム 'face-api.js' は、人種グループ間で顕著な正確性の差を示しており、肌の色が濃い人々が不正行為として誤検出されやすい。
  • 高いセキュリティを謳っているが、熟練した攻撃者によってすべての不正防止措置が容易に回避可能であり、脅威モデルに根本的な欠陥があることが示された。
  • 試験中、試験前のシステムログがベンダーのサーバーに送信されており、最小限のデータ収集の原則に違反している。
  • ソフトウェアのデバッグ防止およびオブスクリューション技術により、独立したセキュリティ分析が困難になり、透明性とユーザーの信頼が損なわれている。
  • 現在の顔認識モデルが、多様なフォーカスグループからの顕著な再設計と参加なしでは、人種的バイアスを解消できないという証拠は見当たらなかった。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。