Skip to main content
QUICK REVIEW

[论文解读] How to detect outliers in data envelopment analysis by Kourosh and Arash method

Dariush Khezrimotlagh|arXiv (Cornell University)|Mar 9, 2015
Efficiency Analysis Using DEA参考文献 59被引用 5
一句话总结

本文提出了数据包络分析(DEA)中异常值的明确定义,并引入了一种基于库罗什与阿拉斯方法(KAM)的简化方法,可在不增加计算复杂度的情况下检测异常值。该方法在基准示例中成功识别出异常值,挑战了DEA本质上无法检测此类点的既有观点。

ABSTRACT

One of the concerns about using non-parametric estimators such as Data Envelopment Analysis (DEA), is the presence of outliers. There are a good number of studies that mention this assessment in the literature of DEA, however, there is no clear definition to identify what outliers are in DEA. Moreover, most of the studies have used additional procedures which have high computational complexities. This paper proposes a suitable definition to identify outliers as well as a simple methodology to illustrate how DEA, by using Kourosh and Arash Method (KAM), is easily able to detect outliers without using additional technologies and their computational complexities. The methodology of detecting outliers by KAM is represented with an example which was used in previous research to depict DEA's weakness of detecting outliers. The results clearly reject this claim that DEA is not able to detect outliers.

研究动机与目标

  • 解决数据包络分析(DEA)中异常值缺乏明确定义的问题,DEA是一种广泛用于效率评估的非参数方法。
  • 克服现有DEA异常值检测方法计算复杂度高的问题,这些方法通常依赖于额外的处理步骤。
  • 证明当结合库罗什与阿拉斯方法(KAM)时,DEA能够有效且高效地检测异常值,而无需借助外部工具。
  • 通过使用一个知名案例的实证证据,挑战文献中长期存在的观点,即DEA本质上无法检测异常值。

提出的方法

  • 基于显著偏离预期范围的极端效率得分,提出DEA中异常值的形式化定义。
  • 应用库罗什与阿拉斯方法(KAM),一种结合输入和输出松弛的改进DEA模型,以识别效率得分异常的观测点。
  • 采用两阶段方法:首先,使用KAM计算效率得分;其次,将效率得分超出统计上合理阈值的观测点标记为异常值。
  • 基于效率得分与样本中心趋势的偏离程度定义异常值状态,以四分位距(IQR)作为参考基准。
  • 通过将异常值检测直接嵌入KAM框架,避免额外的计算程序,从而降低复杂度。
  • 使用先前文献中曾声称DEA在异常值检测中失败的知名案例验证该方法。

实验结果

研究问题

  • RQ1在数据包络分析(DEA)的语境下,什么是有效且一致的异常值定义?
  • RQ2库罗什与阿拉斯方法(KAM)是否能在不依赖计算密集型辅助程序的情况下检测DEA中的异常值?
  • RQ3基于KAM的方法是否能成功识别出此前被引用为DEA无法检测异常值的基准数据集中的异常值?
  • RQ4与现有的DEA异常值检测技术相比,该方法在性能和计算成本方面表现如何?
  • RQ5KAM方法在多大程度上解决了非参数效率模型中定义和检测异常值的模糊性问题?

主要发现

  • 本文基于极端效率得分,建立了DEA中异常值的清晰且可操作的定义,解决了文献中长期存在的模糊性问题。
  • 基于KAM的方法在先前被用作DEA无法识别异常值论据的基准示例中,成功检测出了异常值。
  • 该方法实现了极低的计算开销,因为它将检测过程直接整合到KAM框架中,无需额外算法。
  • 研究结果反驳了DEA本质上无法检测异常值的观点,表明问题不在于方法本身,而在于其应用与解读方式。
  • 该方法具有鲁棒性和可重复性,通过效率得分及其在示例数据集中分布的可视化与数值分析得到验证。
  • 研究证实,只要具备明确定义的标准和计算高效的工具(如KAM),DEA中的异常值检测是可行且有效的。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。