Skip to main content
QUICK REVIEW

[论文解读] Joint Variable Selection for Data Envelopement Analysis via Group Sparsity

Zhiwei Qin, Irene Song|arXiv (Cornell University)|Feb 16, 2014
Efficiency Analysis Using DEA参考文献 41被引用 6
一句话总结

本文提出了一种基于数据驱动的群体变量选择方法,用于数据包络分析(DEA),采用专为DEA设计的损失函数的约束性群体Lasso,并通过定制化的ADMM算法求解。该方法在识别相关变量和估计效率方面显著优于现有基准方法——ECM与RB检验,尤其在输入相关性、样本量和生产维度变化的情况下表现更优。

ABSTRACT

This study develops a data-driven group variable selection method for data envelopment analysis (DEA), a non-parametric linear programming approach to the estimation of production frontiers. The proposed method extends the group Lasso (least absolute shrinkage and selection operator) designed for variable selection on (often predefined) groups of variables in linear regression models to DEA models. In particular, a special constrained version of the group Lasso with the loss function suited for variable selection in DEA models is derived and solved by a new tailored algorithm based on the alternating direction method of multipliers (ADMM). This study further conducts a thorough evaluation of the proposed method against two widely used variable selection methods -- the efficiency contribution measure (ECM) method and the regression-based (RB) test -- in DEA via Monte Carlo simulations. The simulation results show that our method provides more favorable performance compared with its benchmarks.

研究动机与目标

  • 为解决DEA中缺乏系统性、数据驱动的变量选择问题,该问题通常依赖主观的专家判断。
  • 通过仅选择相关输入与输出,减少模型误设并提高判别能力。
  • 开发一种稳健且可扩展的方法,在输入相关性、样本量和生产技术假设变化时仍保持高精度。
  • 通过全面的蒙特卡洛模拟,将所提方法与既有的ECM与RB检验基准进行对比评估。
  • 提供一种简洁的DEA模型,仅使用必要数量的变量,但尽可能减少变量数量,从而增强模型可解释性与效率估计的准确性。

提出的方法

  • 通过推导一种专为DEA的比率型效率估计量设计的特殊约束型群体Lasso,将群体Lasso框架适配于DEA。
  • 实现一种定制化的交替方向乘子法(ADMM)算法,以高效求解约束型群体Lasso优化问题。
  • 利用群体稀疏性对预定义的输入/输出变量组进行联合变量选择,促进完整相关变量集的同时选取。
  • 引入约束条件,确保DEA效率模型保持有效且可解释,保留分段线性前沿结构。
  • 通过ADMM的交替最小化策略,迭代更新变量权重、输入/输出权重与对偶变量,求解优化问题。
  • 采用惩罚结构,当某组变量无关时,可促使整组变量被置零,实现输入/输出组的同步选择与剔除。

实验结果

研究问题

  • RQ1所提出的基于群体Lasso的方法在识别DEA模型中的相关输入与输出方面,相较于ECM与RB检验表现如何?
  • RQ2该方法在输入相关性结构、样本量及生产技术(恒定规模报酬与可变规模报酬)变化下的鲁棒性如何?
  • RQ3在不同模拟设置下,该方法在均方误差(MSE)以及真实效率得分与估计效率得分之间的相关性方面表现如何?
  • RQ4当生产空间维度较高,或输入对输出的贡献显著不同时,该方法是否仍保持优异性能?
  • RQ5在大规模DEA应用中,该方法的计算效率与ECM及RB检验相比如何?

主要发现

  • 所提出的群体Lasso(GL)方法在所有模拟实验中均持续优于ECM方法与RB检验,尤其在正确识别高效与非高效决策单元(DMUs)方面表现更优。
  • 在可变规模报酬(VRS)生产过程中,当输入贡献度变化时,GL方法比RB检验与ECM方法多正确识别5%至27%的高效DMUs。
  • 在高维设置下(实验10),GL方法的均方误差(MSE)至少比RB检验低10倍,且与真实效率得分的相关性高出8%。
  • GL方法在所有实验变体中表现最稳定,包括输入相关性、样本量与生产技术变化,展现出卓越的鲁棒性。
  • GL方法是三者中计算速度最快,显著缩短计算时间,适用于大规模DEA应用。
  • 当输入对输出的贡献度变化时,该方法仍保持强劲性能,准确度几乎无下降;而ECM与RB检验在此类条件下性能显著下滑。

更好的研究,从现在开始

从阅读论文到最终审阅,大幅缩短您的研究时间。

无需绑定信用卡

本解读由 AI 生成,并经人工编辑审核。