[論文レビュー] Geometry- and Accuracy-Preserving Random Forest Proximities
本稿では、ランダムフォレストのペアワイズ類似度を正確に再構築する新しい定義である Random Forest-Geometry- and Accuracy-Preserving proximities (RF-GAP) を導入する。RF-GAP は、近接度に基づく投票によって袋外予測を正確に再現し、学習されたデータの幾何構造をランダムフォレストの予測構造と整合させる。これにより、従来の手法と比較して補完、外れ値検出、可視化の性能が向上する。
Random forests are considered one of the best out-of-the-box classification and regression algorithms due to their high level of predictive performance with relatively little tuning. Pairwise proximities can be computed from a trained random forest and measure the similarity between data points relative to the supervised task. Random forest proximities have been used in many applications including the identification of variable importance, data imputation, outlier detection, and data visualization. However, existing definitions of random forest proximities do not accurately reflect the data geometry learned by the random forest. In this paper, we introduce a novel definition of random forest proximities called Random Forest-Geometry- and Accuracy-Preserving proximities (RF-GAP). We prove that the proximity-weighted sum (regression) or majority vote (classification) using RF-GAP exactly matches the out-of-bag random forest prediction, thus capturing the data geometry learned by the random forest. We empirically show that this improved geometric representation outperforms traditional random forest proximities in tasks such as data imputation and provides outlier detection and visualization results consistent with the learned data geometry.
研究の動機と目的
- 従来のランダムフォレストの近接度と、ランダムフォレストが学習する実際のデータ幾何構造との不一致を解消すること。
- ランダムフォレストモデルの幾何構造と予測精度の両方を保持する近接度定義を開発すること。
- 袋外予測と整合させることで、補完、外れ値検出、可視化などの応用をより正確かつ解釈可能にする。
- 従来の近接度定義がフォレストの袋外予測を再構築できないという問題を理論的根拠と実証的検証をもって補い、代替案を提供すること。
提案手法
- 袋内観測を投票ポイントとして用い、袋外観測の重みを計算することで、RF-GAP 近接度を定義する。
- 各木において、同じ端末ノードを持つ袋内観測の数を正規化した値として、2つの袋外点間の近接度を計算する。
- 近接度に基づく和(回帰)または多数決投票(分類)を用いてラベルを予測し、袋外予測と正確に一致させる。
- クラス内近傍点との逆近接度を用い、メジアンと四分位偏差(MAD)でスケーリングすることで、頑健な近接度に基づく外れ値検出を実装する。
- 多変量スケーリング(MDS)に近接度行列を適用して可視化を行い、点のサイズを外れ値スコアで示す。
- より大きなデータセットへのスケーラビリティを向上させるために、スパース版を実装する。

実験結果
リサーチクエスチョン
- RQ1近接度に基づく予測がランダムフォレストの袋外予測と正確に一致するような、ランダムフォレスト近接度の新しい定義を構築できるか?
- RQ2提案された RF-GAP 近接度測定は、従来の定義と比較して、ランダムフォレストが学習するデータ幾何構造をよりよく反映しているか?
- RQ3RF-GAP は補完、外れ値検出、可視化などの下流タスクの性能を向上させることができるか?
- RQ4RF-GAP は、従来の近接度と RFProxIH と比較して、クラスタ構造をよりよく捉え、誤分類または外れ値とされる点をよりよく特定できるか?
主な発見
- RF-GAP 近接度は、理論的に証明され、実証的にも確認されたように、回帰および分類タスクにおいてランダムフォレストの袋外予測を正確に再現する。
- 補完タスクにおいて、RF-GAP は従来のランダムフォレスト近接度および RFProxIH を上回り、より高い予測精度を示した。
- RF-GAP を用いた外れ値検出は、クラスクラスタからの距離を明確に反映するスコアを生成し、MNIST における曖昧または誤分類された数字に対応する高スコアの点を特定した。
- RF-GAP を用いた可視化では、クラスクラスタの分離が明確になり、外れ値の特定がオリジナルの近接度および RFProxIH よりも正確であった。
- RF-GAP の外れ値スコアは、クラス内点との平均近接度の逆数に比例しており、従来の手法と比較してより解釈可能で一貫性のある測定である。
- 本手法は数千年程度の観測数のデータセットに対してもスケーラブルであり、より大きなデータセットへの適用を可能とするためのスパース実装が提案された。

より良い研究を、今すぐ始めましょう
論文の読解から最終レビューまで、研究時間を劇的に削減しましょう。
クレジットカード登録不要
このレビューはAIが作成し、人間の編集者が確認しました。