Skip to main content
QUICK REVIEW

[論文レビュー] Robust Keystroke Biometric Anomaly Detection

John V. Monaco|arXiv (Cornell University)|Jun 29, 2016
User Authentication and Security Systems参考文献 17被引用数 21
ひとこと要約

本論文では、実世界のデータから得られる長さが異なる、一致しないタイピングシーケンスに対処するため、キーストロークのアラインメントと被験者固有のスコア正規化を用いた耐障害性の高いキーストロークバイオメトリクス異常検出システムを提示する。単純な特徴量を用いても、マンハッタン距離が15のシステムの中で最も低い等誤差率(5.32%)を達成した。性能向上の主な要因は、複雑なモデルではなく、前処理と正規化に起因する。

ABSTRACT

The Keystroke Biometrics Ongoing Competition (KBOC) presented an anomaly detection challenge with a public keystroke dataset containing a large number of subjects and real-world aspects. Over 300 subjects typed case-insensitive repetitions of their first and last name, and as a result, keystroke sequences could vary in length and order depending on the usage of modifier keys. To deal with this, a keystroke alignment preprocessing algorithm was developed to establish a semantic correspondence between keystrokes in mismatched sequences. The method is robust in the sense that query keystroke sequences need only approximately match a target sequence, and alignment is agnostic to the particular anomaly detector used. This paper describes the fifteen best-performing anomaly detection systems submitted to the KBOC, which ranged from auto-encoding neural networks to ensemble methods. Manhattan distance achieved the lowest equal error rate of 5.32%, while all fifteen systems performed better than any other submission. Performance gains are shown to be due in large part not to the particular anomaly detector, but to preprocessing and score normalization techniques.

研究の動機と目的

  • 実世界のバイオメトリクスデータにおいて、被験者が固有の名前と姓を入力する際、長さが異なる、一致しないキーストロークシーケンスの課題に対処すること。
  • テンプレートとクエリシーケンス間の近似一致に適した、固定テキスト手法を可能にする前処理パイプラインの開発。
  • 外れ値や少数のトレーニングサンプルに強く、異常検出性能を向上させる被験者固有の特徴量およびスコア正規化の導入。
  • 実用的な負例トレーニングデータが不足しているため、一クラス学習設定下で、オートエンコーダからマンハッタン距離に至るまでのさまざまな異常検出器の評価。
  • 性能向上の主な要因が異常検出器の選択ではなく、アラインメントと正規化に起因することを実証すること。

提案手法

  • キーストロークアラインメントアルゴリズムにより、修飾キーによる挿入、削除、置換、転置が生じても、クエリとテンプレートシーケンス間の意味的対応を確立する。
  • 特徴抽出では、アラインドシーケンスからのタイミング特徴(例:キーストローク間隔)を用い、被験者固有の最小/最大値または標準偏差による境界で正規化する。
  • 異常検出は、マンハッタン距離、オートエンコーダ、アンサンブル手法など、さまざまなモデルを用い、限られたテンプレートサンプルで訓練する。
  • スコア正規化は、被験者固有の最小/最大値または標準偏差に基づくスケーリングを用い、スコア分布の安定化と一般化性能の向上を図る。
  • システムパイプラインは、アラインメント、特徴正規化、異常スコア算出、スコア正規化を統合し、すべてのコンponentsが異常検出器の選択に依存しない。
  • 不一致するシーケンスを破棄または切り詰めるのではなく、保持することで、有効なデータを最大化し、キャプチャ失敗率を低減する。

実験結果

リサーチクエスチョン

  • RQ1修飾キーの使用によって長さや順序が異なるキーストロークシーケンスを、効果的な異常検出が可能なようにアラインメントする方法は何か?
  • RQ2低データ量、一クラス設定下において、特徴量およびスコア正規化技術は、異常検出性能にどの程度寄与するか?
  • RQ3頑健な前処理が適用された場合、マンハッタン距離のような単純な異常検出器が、複雑なモデルを上回る性能を発揮できるか?
  • RQ4テンプレート収集後からクエリ収集までの時間間隔が長くなると、異常検出システムの性能はどのように変化するか?
  • RQ5全体のシステム性能に与えるアラインメントと正規化の寄与度と、異常検出器の選択の寄与度の相対的寄与度は何か?

主な発見

  • マンハッタン距離が、15のすべてのシステムの中で最も低い等誤差率(5.32%)を達成し、オートエンコーダーやアンサンブル手法などのより複雑なモデルを上回った。
  • 最も性能の良かったシステム(システム6)は、時間経過に伴う性能低下が最小限に抑えられ、テンプレート収集後2か月から4か月後のテストでEERがたった0.01%上昇したにとどまった。
  • 性能向上の主な要因はキーストロークアラインメントとスコア正規化であり、異常検出器の選択によるものではなかった。これは、すべてのモデルで一貫した向上が見られたことから裏付けられた。
  • 標準偏差に基づく正規化は、極端な値に敏感な最小/最大正規化よりも外れ値に対してより頑健であった。
  • 15の上位システムすべてが、他のすべての提出物よりも低いEERを達成しており、多様なモデルおよび前処理戦略にわたる強力な一般化性能を示した。
  • 長期間にわたりシステムは頑健であったことから、キーストロークプロファイルが素早く安定し、時間的変動に耐性があることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。