ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

MaxDEA超效率DEA实操全解析:从模型原理到结果解读

MaxDEA超效率DEA实操全解析:从模型原理到结果解读 做效率评价的这拨人应该都遇到过同一个尴尬DEA跑完几十个决策单元一大半效率值都是1排名分不出来论文里只能写“这些单元均处于有效前沿”然后就没下文了。但评审老师往往追着问既然都有效到底哪个更强标杆是谁这时候就得请出超效率DEASuper Efficiency DEA来补刀。超效率DEA最核心的价值就是让原本效率值封顶在1的有效单元继续“加考附加题”算出大于1的效率值从而拉开排序差距。而MaxDEA是国内做DEA分析用得相当多的软件界面直观、模型集成度高处理超效率模型比DEAP顺滑太多。这篇文章就围绕“MaxDEA如何计算超效率DEA”把整个流程拆开讲从模型原理到数据准备从软件操作到结果解读再到我踩过的那些坑一次性理清楚。1. 超效率DEA到底在解决什么问题1.1 传统DEA的“并列第一”困局先聊一个比较容易忽视但很关键的问题标准DEA给每个决策单元DMU打分效率值是介于0到1之间的达到1就认为到达效率前沿。问题就出在这里——如果一批DMU都站在这条前沿线上它们的分数就全部是1。这说明什么说明这些单元在现有指标体系下都是“有效”的但从实际管理角度来看它们之间的投入产出效率很可能存在细微差异只是标准DEA的分辨率不够区分不出来。就好比一场考试60分及格凡考到60分的一律算及格但你不知道考61分的和考100分的到底差多远。这里就要提到超效率DEA了。它由Andersen和Petersen在1993年提出核心思路很直接在评价某个DMU的时候把它自己从参考集里拿出来只用剩下的DMU去构造效率前沿再来看这个被“踢出群聊”的DMU离新的前沿还有多远。如果它原本就在前沿上去掉它之后前沿后退了它反而能测出一个大于1的效率值。1.2 超效率的超在哪里把被评单元踢出参考集这句话值得再强调一遍超效率DEA与普通DEA唯一的计算差异就是每个被评DMU都不参与构造它自己的参考前沿。放个大白话例子。假设有三家银行A、B、CB和C都是有效率的但B的投入更低、产出更高。普通DEA里B和C都是1分超效率DEA看B时把B从参考集移除用A和C构造新前沿此时B的效率可能是1.35看C时把C移除用A和B构造新前沿C的效率可能是1.12。于是B和C之间就有了高下之分1.35 1.12B不仅是有效的而且比C更“超”出前沿更抗风险。需要注意超效率值大于1不代表它真的能无限压缩投入或扩张产出而是表示它在自身基础上的效率边际空间。这个值越大说明该DMU在同类里越稳。反过来原本就无效的DMU效率和普通DEA结果方向一致数值仍然小于1变化幅度也不大所以超效率模型并不会颠覆原有的无效判断它主要在有效单元之间做排序。1.3 超效率DEA不是万能药它适合什么场景超效率DEA最常见的应用场景是环境保护效率、能源效率、金融运营效率这类需要给大量评估对象排名的研究。比如很多论文里用超效率SBM模型测算区域碳排放效率把各省份按超效率值做个连续排名后面对比回归分析就好做了。但也要说清楚超效率模型并非适合所有情况。如果数据质量差、异常值多超效率值可能会被极端数据拉到一个不合理的水平。另外如果DMU数量很少、指标又很多超效率的区分度也会变得不稳定。一般在做效率排名和样本分组时用超效率比较合适但如果你想计算无效单元的改进比例和投影值标准DEA反而更直观。所以用超效率之前先确认你的目标到底是“排名”还是“改进测算”。2. 用MaxDEA算超效率前先把准备做足2.1 数据表格式一次性摆平MaxDEA对数据格式有要求但要求不算苛刻。说几个实际使用中必须注意的点都很容易出问题。第一数据文件建议用Excel格式xlsx或xls都行。表格的第一列放DMU名称也就是决策单元的标签必须是文本形式比如“省份A”“银行01”“企业甲”这类。从第二列开始放变量数据全部是数值型的不能有文字说明混在同一列里不然软件会读不进去。第二变量的排列顺序没有强制要求投入产出可以任意排列但建议在操作表里主动做区分比如前几列全是投入后几列全是产出。这样做的好处是设置变量类型时好管理不容易漏选或错选。第三表格里不要出现“合计”“平均值”“增长率”这类多余的汇总行。我见过有人为了方便在Excel里顺手加了一行合计结果MaxDEA把那行也当成一个DMU读进去了后面的结果全乱套。第四关于数据的单位问题。投入和产出的单位不要求统一比如投入可以是“万元”产出可以是“吨”DEA对无量纲化有较好的容忍性。但量级差距太大也会影响计算稳定性比如某个投入是0.01另一个投入是100000建议先做同向归一化处理。2.2 径向还是非径向模型选择背后的逻辑MaxDEA里超效率模型大体分两类一类是径向模型一类是非径向模型选择很关键。径向模型就是经典的Andersen-Petersen超效率模型它的特点是假设投入产出按同一比例缩放计算得到的超效率值是单一的缩放系数。这个模型的优点是简单直观结果也容易被同行理解但它有个硬伤当数据里有零值或负值时无法计算更麻烦的是在规模报酬可变VRS条件下径向超效率经常出现无解的情况这在后面我会专门展开讲。非径向模型的代表是超效率SBM模型Slack-Based Measure基于松弛变量的测度。它允许投入和产出的调整比例不同能处理零值对无效单元的松弛变量也利用得更充分。如果你的指标里有些数恰好为0比如某些能源消耗为0的样本那径向模型基本会报错SBM模型就是这个局面的“救兵”。所以我的选择习惯是这样的数据干净、全部为正、只是想快速排序时用径向超效率数据里有零值、有非期望产出、或者希望结果更稳健时优先用超效率SBM。2.3 导向与规模报酬两种关键设定的取舍导向的选择决定了模型优化的方向。投入导向意思是产出固定看投入最多能压缩多少产出导向意思是投入固定看产出最多能扩多少非导向即同时调整投入和产出比较接近全要素效率的评估思路。实际做研究时导向选择要跟着研究问题走。比如研究银行分支机构的效率通常认为分支机构对产出的控制力有限但投入成本可以压缩这时选投入导向更合理。如果研究的是环境效率产出里包含污染物一般更倾向用非导向模型因为它不偏向某一侧。规模报酬的设定同样重要。规模报酬不变CRS假设所有DMU都在最优规模上运行模型简单超效率计算也稳定一些规模报酬可变VRS则允许不同DMU处于规模递增、不变或递减的不同阶段更贴近现实但VRS条件下径向超效率很容易出现无解情况。这一点一定要在开始之前就考虑清楚不要等算出成片N/A再后悔。3. MaxDEA超效率实操完整操作流程3.1 读入数据与变量类型设置打开MaxDEA软件后第一步是读入数据。界面顶部菜单找到File或数据加载入口选择Open Data定位到准备好的Excel文件确认后数据表会显示在软件主窗口中。数据加载后软件会自动识别变量列但通常还需要手动指定哪几列是投入、哪几列是产出。以MaxDEA较常见的界面布局为例变量设置区会列出所有数值列下面有Input和Output两个分组勾选区。这时候要仔细核对每组里选中的列是不是和你的研究设计一致千万别把投入勾进产出。这里有个容易踩的坑如果表里含有DMU名称列的文本信息软件一般会自动识别为标签列不参与计算。但万一你的Excel第一列不是名称而是序号或者名称列里混入了数字软件可能把它当成数值变量这样计算结果就全错了。建议载入后先看一眼软件中识别出的变量列表确认第一列被排除在投入产出之外。3.2 选择超效率模型并配置参数数据就绪后进入模型设置环节。MaxDEA的模型菜单里通常有一个模型类型选择区域常见的层次是先选径向或非径向再选是否考虑超效率再选是否处理非期望产出。以常用的超效率SBM为例操作路径大致是选择SBM模型在模型变体里找到Super Efficiency SBM也就是超效率SBM。如果你需要处理非期望产出比如污染物还需要在非期望产出设置区把对应的产出变量标记为Undesirable Output。接着设置模型的导向方向。下拉菜单里一般会有Input-oriented、Output-oriented、Non-oriented三个选项按你的研究问题选一个。然后设置规模报酬在CRS和VRS之间选一个。如果选了VRS同时模型是径向超效率那就要做好部分DMU可能无解的准备。MaxDEA还允许用户选择是否输出松弛变量、投影值、排名等信息。如果论文里需要用到改进建议或标杆参照建议把松弛变量和投影值选项勾上。设置完之后点击运行计算按钮软件会生成结果表。3.3 计算结果的生成与保存结果生成之后MaxDEA通常会以表格形式展示核心的效率数值会在结果表里体现。需要说明的是不同版本结果字段的命名略有差异但找效率值那一列基本不会错。计算完成后建议做两件事。第一件事是把结果导出保存避免软件意外关闭导致数据丢失。MaxDEA一般支持将结果表复制到Excel或者直接导出为文件按需操作即可。第二件事是回到原始数据检查一遍确认参与计算的有效DMU数量和预期一致防止有DMU因为格式问题被自动排除。补充一个非常实用的操作细节MaxDEA支持一次计算多个模型的效率结果如果你需要对比径向超效率和SBM超效率的差异可以在模型设置里建多个任务分别运行然后把结果汇总到同一张表里做对比这样比每次重新设置再计算要高效得多。4. 结果表怎么看效率值、排序与投影分析4.1 效率值的三种情况拿到MaxDEA输出的效率值后先把数值分成三类来读。第一类效率值小于1说明该DMU在当前参考集下仍然是无效的。虽然超效率模型对有效单元的排序能力很强但对无效单元的排名逻辑和标准DEA基本一致可以继续往下做投影分析找改进量。第二类效率值等于1代表该DMU刚好处于有效边界。这种情况在超效率模型里相对不多见因为正常有效单元一般会被算出大于1的值。如果出现卡在1的情况通常说明该DMU和剩余单元构造的前沿刚好贴合。第三类效率值大于1这是超效率模型最核心的输出。它表示该DMU在去掉自身后仍然能保持相当的效率水平。数值越大说明它离前沿越远也就是“超前”的优势越大排名越靠前。还有一个细节需要注意超效率值的大小会受到导向和模型类型的影响。投入导向和产出导向算出的超效率值含义不同不能直接跨导向比较。比较排序时应统一模型设定后再看名次。4.2 从结果倒推改进方向很多人算完超效率只盯着排名看忽略了MaxDEA输出的投影值Projection和松弛变量Slack。其实这些字段对无效单元的分析非常有价值。以投入导向的SBM模型为例结果表里每个无效DMU的投影值会给出理论最优投入量。把原始投入减去投影投入就得到“投入冗余”。投入冗余越大说明该DMU在投入端浪费越严重。产出端同理如果用的是非导向模型还能看到产出不足的部分。我自己的经验是写完超效率排名之后顺手把投入冗余率算出来列一个“资源改进清单”这样整篇分析既有排名又有改进方向逻辑链完整得多。评审看的时候也会觉得你的分析不是只做了一个得分列表。5. 常见问题与排查技巧实录5.1 VRS超效率无解的处理思路这是我用MaxDEA算超效率时遇到最多的情况几乎每个用径向超效率配VRS的人都撞过这堵墙。模型跑完之后结果表里一大片N/A或者Infeasible乍看还以为是软件出问题了其实这是Andersen-Petersen径向超效率模型在VRS条件下的固有缺陷某些去前沿单元后线性规划会不可行导致无解。遇到这种情况先不要慌按顺序排查。第一步检查是不是所有DMU都无解如果只有个别单元无解那多半就是模型本身的问题。第二步把规模报酬改成CRS重新计算一般情况下无解问题就消失了。第三步如果研究设计强制要求VRS那就放弃径向模型改用超效率SBM模型SBM系模型在处理VRS时的无解概率显著降低。5.2 效率值异常偏大的排查超效率值大于1是正常的但大到离谱就值得警惕了。比如某个DMU的效率值算出3.5甚至更高先不要急着写进论文得回头查数据。常见的原因有这么几个一是该DMU的某项产出特别大而其他DMU在这个指标上普遍接近0导致它在剔除自身后几乎无法被追赶二是投入变量里存在极小值比如某项投入是0.01而别人是100这种数量级差异会把超效率值推得很高三是样本量太少参考集合缺乏约束力。排查方法是先看效率值最高的几个DMU的原始数据分布确定它们是不是存在极端值。如果确认数据无误那超效率值大就可以解释为“领先优势明显”。如果发现是录入错误或单位不一致赶紧修正数据重新计算。5.3 数据导致计算失败的典型情况MaxDEA报错并不都是模型的锅很多时候是数据问题。我常用的排查清单大概是这样的数据表第一行不是变量名而是数据、第一列不是文本而是数字、数值列里有空单元格、Excel文件中存在公式残留或隐藏空格这些都可能让MaxDEA读取出错或者计算出NaN结果。另外老版本MaxDEA对中文文件路径的兼容性一般建议把项目文件夹路径改成纯英文能省掉不少莫名其妙的读取失败问题。还要提醒一点某些情况下MaxDEA计算完但效率值全是1看起来“大家都有效”其实很可能是指标设置有问题。比如投入产出指标选了重复列或者把DMU名称列误选成投入软件就会给出一个完全没有区分度的结果。养成每次算完都核对“变量列表”和“有效DMU数量”的习惯能帮你及时发现问题。5.4 一个关于样本数量的提醒关于DEA的样本量要求业内一直有不同说法。常用的经验法则是DMU数量不能少于投入产出指标总数的3倍我建议最少也不要低于2倍。比如你有3个投入、2个产出指标总数是5那DMU最好不低于15个。样本量太少、指标太多会导致大量DMU自动有效超效率模型也无力回天。如果数据实在有限可以尝试减少指标数量合并相关性高的指标。不过合并时要谨慎不能为了凑样本量而牺牲指标体系的理论依据。我个人在实际操作中还有一个习惯每跑完一次模型先看一眼“有效DMU占比”。如果有效单元占比超过一半说明指标区分度不高或者样本量偏小这时候算出的超效率排序也不够稳定宁可调整指标设置也不硬用结果。最后再分享一个小感受。MaxDEA算超效率这件事难点从来不在“点哪个按钮”而在于对模型逻辑和数据特性的理解。你用径向超效率还是超效率SBM用CRS还是VRS这些选择都会直接影响结果的方向和解释方式。多跑几次、多对比不同模型下的排名变化你对数据的判断力会比只看一套结果强得多。如果下次再有人问你超效率DEA怎么算你可以直接告诉他先把数据格式收拾利索再把模型设定想明白最后点计算剩下的就是解读的功夫了。
返回列表