Skip to main content
QUICK REVIEW

[论文解读] An adaptive nearest neighbor rule for classification

Akshay Balsubramani, Sanjoy Dasgupta|arXiv (Cornell University)|May 29, 2019
Machine Learning and Algorithms参考文献 17被引用 10
一句话总结

本文提出一种自适应 k-近邻(AKNN)分类器,根据局部标签置信度动态选择每个查询点的邻域大小 $k$,使用置信度阈值 $Δ(n,k) \sim \sqrt{\log n / k}$。该方法在泛化误差率上达到或优于使用最优固定 $k$ 的 $k$-NN,收敛速率由一种弱于传统利普希茨条件的局部“优势”度量所决定。

ABSTRACT

We introduce a variant of the $k$-nearest neighbor classifier in which $k$ is chosen adaptively for each query, rather than supplied as a parameter. The choice of $k$ depends on properties of each neighborhood, and therefore may significantly vary between different points. (For example, the algorithm will use larger $k$ for predicting the labels of points in noisy regions.) We provide theory and experiments that demonstrate that the algorithm performs comparably to, and sometimes better than, $k$-NN with an optimal choice of $k$. In particular, we derive bounds on the convergence rates of our classifier that depend on a local quantity we call the `advantage' which is significantly weaker than the Lipschitz conditions used in previous convergence rate proofs. These generalization bounds hinge on a variant of the seminal Uniform Convergence Theorem due to Vapnik and Chervonenkis; this variant concerns conditional probabilities and may be of independent interest.

研究动机与目标

  • 开发一种能够根据局部数据特征自适应调整 $k$ 而非使用固定 $k$ 的最近邻分类器。
  • 通过自适应增大 $k$ 来改善高噪声或低标签置信度区域的泛化性能。
  • 建立依赖于局部分类难度度量(称为“优势”)的理论收敛速率,而非依赖全局光滑性假设。
  • 证明该自适应规则在弱于先前 $k$-NN 理论的条件下,仍能实现普遍一致性并具备竞争力的收敛速率。
  • 提供一种实用算法,通过在置信度较低时允许拒绝对预测,实现准确率与覆盖范围之间的平衡,其中置信度参数 $A$ 可调节。

提出的方法

  • 该算法选择最小的 $k$,使得 $k$-近邻中标签的平均值在绝对值上超过置信度阈值 $\Delta(n,k) = \sqrt{\log n / k}$。
  • 对于二分类问题,若平均标签超过 $+\Delta(n,k)$,则预测为 $+1$;若低于 $-\Delta(n,k)$,则预测为 $-1$;若两者均不满足,则预测为 '?'。
  • 在多分类设置中,该规则扩展为寻找最小的 $k$,使得任意类别 $y$ 的经验标签频率超过 $1/|\mathcal{Y}| + \Delta(n,k)$。
  • 通过 $\Delta = A / \sqrt{k}$ 引入置信度参数 $A$,用于控制准确率与覆盖范围(拒绝对预测)之间的权衡。
  • 停止规则基于经验标签均值的统计置信区间,确保在数据充足时以高概率保证正确性。
  • 该方法使用了针对条件概率的 vapid-chervonenkis 一致收敛定理的变体,从而实现更紧的泛化界。

实验结果

研究问题

  • RQ1通过为每个查询点自适应调整 $k$,最近邻分类器能否实现与使用固定 $k$ 的 $k$-NN 相当或更优的性能?
  • RQ2对于此类自适应规则,其收敛速率与一致性的理论保证为何?
  • RQ3在不同噪声水平和数据分布下,该自适应规则的性能与使用最优 $k$ 的 $k$-NN 相比如何?
  • RQ4能否用局部难度度量——“优势”——替代收敛速率分析中的全局光滑性假设(如利普希茨连续性)?
  • RQ5置信度参数 $A$ 的选择在实践中如何影响预测准确率与覆盖范围(拒绝对预测)之间的权衡?

主要发现

  • 该自适应 k-NN 规则在与 $k$-NN 相同的条件下实现渐近一致性,其收敛速率取决于一种弱于利普希茨条件的局部“优势”度量。
  • 该算法在性能上与使用最优固定 $k$ 的 $k$-NN 相当,甚至在某些情况下更优,尤其在需要更大 $k$ 的高噪声区域表现更佳。
  • 在 notMNIST 数据集上,当 $A=1$ 时,AKNN 达到 88% 的准确率与 100% 的覆盖范围,优于最佳 $k$-NN 表现($k=10$,约 88% 准确率)。
  • AKNN 选择的邻居数量是预测置信度的局部代理:在标签置信度低或噪声高的区域,会选择更大的 $k$ 值。
  • 提高置信度参数 $A$ 会提升准确率,但降低覆盖范围,因为算法在不确定预测时会更频繁地拒绝对。
  • 在 MNIST 上模拟标签噪声的实验中,AKNN 表现优于固定 $k$ 的 $k$-NN,后者在高噪声水平下因 $k$ 过小而性能显著下降。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。