Skip to main content
QUICK REVIEW

[论文解读] The Signed Distance Function: A New Tool for Binary Classification

Erik M. Boczko, Todd Young|ArXiv.org|Nov 30, 2005
Spectroscopy Techniques in Biomedical and Chemical Research参考文献 20被引用 10
一句话总结

本文提出将有符号距离函数(SDF)作为二分类中指示函数的几何替代方法,利用其平滑性及内在的到边界距离信息。一种简单且未经优化的基于SDF的分类器在线性问题上比标准SVM减少50%的误分类,且在非线性基准微阵列数据集上表现匹配或超过SVM性能。

ABSTRACT

From a geometric perspective most nonlinear binary classification algorithms, including state of the art versions of Support Vector Machine (SVM) and Radial Basis Function Network (RBFN) classifiers, and are based on the idea of reconstructing indicator functions. We propose instead to use reconstruction of the signed distance function (SDF) as a basis for binary classification. We discuss properties of the signed distance function that can be exploited in classification algorithms. We develop simple versions of such classifiers and test them on several linear and nonlinear problems. On linear tests accuracy of the new algorithm exceeds that of standard SVM methods, with an average of 50% fewer misclassifications. Performance of the new methods also matches or exceeds that of standard methods on several nonlinear problems including classification of benchmark diagnostic micro-array data sets.

研究动机与目标

  • 开发一种基于几何原理的、替代基于指示函数的分类方法。
  • 探究有符号距离函数(SDF)——其编码了到边界的距离信息——是否在二分类中优于传统指示函数。
  • 评估基于SDF的分类器在合成几何问题和真实世界生物医学数据上的性能。
  • 探索利用SDF重建作为更精确、更可靠分类算法基础的可行性。

提出的方法

  • 该方法从训练数据中重建正类边界的有符号距离函数(SDF),其中SDF值在类内部为正,外部为负,边界上为零。
  • 对于每个训练样本,通过计算其到训练集中反类最近点的欧氏距离来近似SDF值。
  • 然后使用SDF值作为标签,训练一个简单的线性分类器,其中线性模型用于预测测试样本处的SDF值。
  • 最终的分类决策通过将预测的SDF值在零处进行阈值化确定:正值表示属于该类。
  • 对于非线性问题,该方法采用基于核的回归(如高斯核)来建模SDF,类似于SVM和RBFN方法。
  • 该方法与SVM、RBFN和KNN进行直接比较,使用相同的训练/测试划分和超参数设置,确保评估的公平性。

实验结果

研究问题

  • RQ1有符号距离函数(SDF)能否作为二分类比传统指示函数更有效的几何基础?
  • RQ2与标准SVM方法相比,基于SDF的分类在可线性分离问题上的表现如何?
  • RQ3基于SDF的分类器能否在复杂、非线性、高维的生物医学数据集上匹配或超越最先进的SVM性能?
  • RQ4在回归框架中使用SDF值作为标签对分类性能有何影响?
  • RQ5SDF框架是否能通过距离到决策边界的信息自然地提供置信度估计?

主要发现

  • 在可线性分离的问题上,未经优化的基于SDF的分类器平均比标准SVM方法减少50%的误分类。
  • 在4×4棋盘几何问题上,基于SDF的方法优于标准SVM方法。
  • 在乳腺癌(ER)数据集上,SDF分类器的误分类率为8.69%,与最佳SVM性能持平。
  • 在结肠癌数据集上,SDF分类器的误分类率为16.62%,优于SVM的17.00%。
  • 在白血病数据集上,SDF分类器以1.67%的误分类率匹配了最佳SVM性能。
  • 基于SDF的方法在多个基准微阵列数据集上表现出一致的性能,通常与SVM准确率持平或更优,且无需优化。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。