Skip to main content
QUICK REVIEW

[論文レビュー] Using Regression Kernels to Forecast A Failure to Appear in Court

Richard A. Berk, Justin Bleich|arXiv (Cornell University)|Sep 5, 2014
Advanced Statistical Methods and Models参考文献 47被引用数 5
ひとこと要約

この論文は、主成分分析による正則化を施したカーネルベースの回帰手法を提案し、裁判廷への不出席(FTA)を予測するもので、従来の段階的ロジスティック回帰を上回る性能を示す。予測変数をカーネル関数で変換し、カーネル行列の固有値分解により次元削減を行うことで、小規模から中規模のデータセットでも高い予測精度を達成でき、フィラデルフィアの予審データを用いた実世界のFTA予測タスクにおいて優れた性能を示した。

ABSTRACT

Forecasts of prospective criminal behavior have long been an important feature of many criminal justice decisions. There is now substantial evidence that machine learning procedures will classify and forecast at least as well, and typically better, than logistic regression, which has to date dominated conventional practice. However, machine learning procedures are adaptive. They "learn" inductively from training data. As a result, they typically perform best with very large datasets. There is a need, therefore, for forecasting procedures with the promise of machine learning that will perform well with small to moderately-sized datasets. Kernel methods provide precisely that promise. In this paper, we offer an overview of kernel methods in regression settings and compare such a method, regularized with principle components, to stepwise logistic regression. We apply both to a timely and important criminal justice concern: a failure to appear (FTA) at court proceedings following an arraignment. A forecast of an FTA can be an important factor is a judge's decision to release a defendant while awaiting trial and can influence the conditions imposed on that release. Forecasting accuracy matters, and our kernel approach forecasts far more accurately than stepwise logistic regression. The methods developed here are implemented in the R package kernReg currently available on CRAN.

研究の動機と目的

  • 機械学習の予測性能を活用しつつ、小規模~中規模の刑事司法データセットに適用可能な予測手法を開発すること。
  • 従来のロジスティック回帰が小規模サンプルで直面する限界を克服し、観察数より予測変数が多い状況でも対応可能なカーネル手法を活用すること。
  • ブラックボックスの機械学習モデルとは異なり、実用的で解釈可能かつ正確な代替手法を予審リスク評価に提供すること。
  • フィラデルフィアの実世界データを用いて、裁判廷への不出席(FTA)を予測する手法の有効性を実証すること。
  • 大規模データセットが入手不可能な特殊な裁判所や小規模な管轄区域においても、正確な予測が可能となるようにすること。

提案手法

  • 元の予測変数にカーネル変換を適用し、複雑な非線形関係を捉えられる高次元の特徴空間に写像する。
  • カーネルトリックを用いて高次元特徴の明示的計算を避ける。代わりに、データから導かれるカーネル行列を直接処理する。
  • 中心化されたカーネル行列に対して主成分分析を適用し、最も情報量の多い次元を抽出することで、次元削減を実現しつつ分散を保持する。
  • 得られた低次元表現をロジスティック回帰モデルの入力とし、過学習を防ぐために正則化を施す。
  • 新規のケースに対しては、カーネル関数を新規観測値と学習データとの間に適用し、モデル学習時と同じ主成分部分空間に射影することで予測を生成する。
  • 高次元特徴写像を明示的に構築せずに、中心化されたカーネル行列の固有値分解に基づいて射影を計算する。

実験結果

リサーチクエスチョン

  • RQ1主成分分析による正則化を施したカーネルベースの回帰は、段階的ロジスティック回帰に比べ、裁判廷への不出席(FTA)の予測において優れた性能を示すか?
  • RQ2従来の機械学習が困難とする小規模~中規模のサンプルサイズにおいて、この手法は高い予測精度を維持できるか?
  • RQ3大規模データセットを必要とせずに、カーネル手法が刑事司法データの非線形パターンを効果的に捉えることができるか?
  • RQ4実世界の予審環境において、このカーネル正則化手法の性能は、従来のリスク評価ツールと比べてどの程度優れているか?
  • RQ5本手法は、データ収集が限られた特殊な裁判所や小規模管轄区域の裁判所において、どの程度応用可能か?

主な発見

  • 主成分分析による正則化を施したカーネルベースの回帰手法は、裁判廷への不出席(FTA)予測において、段階的ロジスティック回帰を著しく上回る高い予測精度を達成した。
  • 本手法は、予測変数の数が観察数を上回るという、小規模管轄区域の刑事司法データに一般的な課題に対しても効果的に対応できた。
  • カーネルトリックとカーネル行列の固有値分解を用いることで、高次元特徴空間の明示的計算を回避しつつも、予測力は保持された。
  • モデル学習時に定義された同じ低次元部分空間に新規観測値を射影することで、新規ケースに対しても正確な予測が可能となった。
  • 本手法はRパッケージkernRegとしてCRANに公開されており、研究者や実務家が容易に利用可能である。
  • 本研究では、カーネル正則化を用いることで、小規模データ環境でも機械学習に匹敵する性能を達成でき、ブラックボックスモデルの代替として実用的であることが示された。

より良い研究を、今すぐ始めましょう

論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。

クレジットカード登録不要

このレビューはAIが作成し、人間の編集者が確認しました。