ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

【Python机器学习】零基础掌握单模型预测不稳定时的集成决策思路

【Python机器学习】零基础掌握单模型预测不稳定时的集成决策思路 同一个模型换一批训练样本,效果就明显变化,应该马上换成随机森林吗?如果两个模型的分数只差一点点,值得再叠加一个投票模型吗?集成学习真正要解决的是具体的建模问题,而不是把算法排成一张固定的性能榜。本文用一组可复现的模拟二分类数据,从单棵决策树出发,依次检查训练与验证差距、不同数据划分下的波动,再比较随机森林、直方图梯度提升和软投票。最后依据事先说明的规则选择模型,并用一直没有参与选择的测试集检查结果。模拟数据只用于展示判断过程,不代表任何真实业务的性能。文章目录单模型预测为什么不稳定先用基线和交叉验证定位问题Bagging、Boosting 与模型融合该怎么选用相同数据检验效果与计算成本集成没有改善结果时如何排查总结单模型预测为什么不稳定假设要根据 20 项数值特征判断一件产品是否需要复检。我们有 1500 条样本,其中目标类约占 29%。如果一棵决策树在训练集上几乎全对,而换一批样本就掉分,应先区分不稳定的来源:不稳定来源典型表现优先核对的方向模型过于灵活深树记住训练样本中的偶然细节,训练分数很高,验证分数明显较低限制模型复杂度,并比较训练与验证结果评估样本有限不同划分恰好包含的难例不同,得分随划分波动使用符合业务场景的多次验证,而非依赖一次划分数据本身发生变化训练和未来使用时的样本来源、标签规则或特征分布不同单独检查新数据;更复杂的集成方法不能自动解决分布变化因此,看到“预测不稳定”时,第一步不是选算法,而是问:波动发生在训练与验证之间,还是发生在不同验证划分之间?如果已经上线,还需要单独核对线上数据是否与训练时一致。本文展示的交叉验证只能帮助观察前两类现象。它无法证明未来数据不会发生分布变化。先用基线和交叉验证定位问题实验先用
返回列表