Skip to main content
QUICK REVIEW

[论文解读] A simple technique for improving multi-class classification with neural networks

Thomas Kopinski, Alexander Gepperth|arXiv (Cornell University)|Jan 6, 2016
Hand Gesture Recognition Systems参考文献 9被引用 5
一句话总结

本文提出一种两阶段神经网络融合技术,以提升多类别手势分类性能,其中第一阶段的一对多(OAA)网络生成类别得分,并在第二阶段与原始输入进行融合。该方法使整体准确率提升2–3%,显著改善了难以区分手势的识别效果,对最模糊的类别准确率提升最高达4.8%。

ABSTRACT

We present a novel method to perform multi-class pattern classification with neural networks and test it on a challenging 3D hand gesture recognition problem. Our method consists of a standard one-against-all (OAA) classification, followed by another network layer classifying the resulting class scores, possibly augmented by the original raw input vector. This allows the network to disambiguate hard-to-separate classes as the distribution of class scores carries considerable information as well, and is in fact often used for assessing the confidence of a decision. We show that by this approach we are able to significantly boost our results, overall as well as for particular difficult cases, on the hard 10-class gesture classification task.

研究动机与目标

  • 解决在类别间高度相似的复杂、模糊手势识别任务中多类别分类的挑战。
  • 提升神经网络在10类3D手势识别任务中的泛化性能,该任务因视觉与空间上的模糊性而构成特别具有挑战性的基准。
  • 开发一种实用、可训练的融合机制,提升决策置信度与歧义消除能力,而无需复杂的重训练或架构重构。
  • 在包含15名受试者共45万个样本的大规模真实世界数据集上评估该方法,确保在个体间具有鲁棒性与泛化能力。

提出的方法

  • 首先,使用具有全连接层的三层架构标准一对多(OAA)多层感知机(MLP),将输入描述符分类为10个类别得分。
  • 其次,第二个MLP将原始点云描述符与第一阶段网络输出的类别得分作为输入,实现原始特征与置信度信息的融合。
  • 融合层结合原始输入与类别得分,以优化预测结果,使网络能够学习模糊类别之间的复杂决策边界。
  • 两阶段网络采用三部分划分进行训练:40%用于训练(D1和D2),20%用于泛化测试(D3),并采用内部9:1的训练/测试划分以进行监控。
  • 通过人员无关的交叉验证对方法进行评估,即在训练时排除每位受试者,性能在未见数据上进行测量。
  • 该方法在大规模3D手势数据集上进行了验证,并与标准单网络基线方法进行比较,结果报告涵盖15名受试者与10个手势类别。

实验结果

研究问题

  • RQ1将一对多网络生成的类别得分与原始输入融合,是否能提升模糊手势识别中的多类别分类性能?
  • RQ2与标准单网络方法相比,所提出的两阶段架构是否能显著降低难以区分手势类别的分类错误率?
  • RQ3在真实世界设置中,置信度得分(类别输出)与原始特征的融合如何影响模型在不同个体间的泛化能力?
  • RQ4该方法是否可通过基于置信度的误报拒识,稳定实时系统中的识别性能?
  • RQ5隐藏层大小的变化对融合技术性能提升有何影响?

主要发现

  • 与基线单网络OAA方法相比,两阶段融合网络使整体分类准确率提升2–3%,在最模糊的手势类别上最高提升达4.8%。
  • 对于最难区分的两个手势类别b和i,识别率分别提升了4.8%和4.7%,表明在困难样本上取得了显著改进。
  • 在10个手势类别中的8个类别上,融合方法提升了识别率;仅类别c和d出现轻微下降,分别为-2.1%和-2.8%。
  • 在非人员特定的数据划分上评估时,融合模型达到87%的准确率,而基线为86%,证实了在不同数据划分中的一致性增益。
  • 该方法在不同隐藏层大小(40、25、20个神经元)下均表现出鲁棒性,即使在较小架构中也观察到一致的性能提升。
  • 该方法成功集成至实时手势识别系统中,提升了决策稳定性,并实现了基于置信度的误报拒识。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。