ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

案例分析-房屋销售价格预测

案例分析-房屋销售价格预测 1 项目背景与研究目标Ames 房价数据包含住宅物理属性、区位、质量、年代、配套和交易条件能够完整展示回归预测中的缺失值处理、目标变换、类别编码、共线性控制、异常值识别和误差诊断。描述房价分布并说明为何采用对数目标。识别与售价关系密切的质量、面积、区位和年代变量。通过业务含义构造综合面积、卫浴、房龄和质量交互特征。比较线性正则化模型与树模型的交叉验证表现。从实际—预测图、残差图和分价格区间误差解释模型局限。2 数据来源与变量结构数据来源于 Kaggle “House Prices - Advanced Regression Techniques” 竞赛训练集公开镜像共 1,460 行、81 列。除 Id 和 SalePrice 外包含 79 个房屋描述变量。变量组代表字段分析含义目标变量SalePrice房屋销售价格质量与状况OverallQual、OverallCond整体材料、装修质量和维护状况面积GrLivArea、TotalBsmtSF、1stFlrSF住宅空间规模区位Neighborhood、MSZoning社区与规划用途年代YearBuilt、YearRemodAdd建筑年龄和翻修时间车库/地下室GarageCars、GarageArea、BsmtQual附属空间和功能配置交易条件SaleType、SaleCondition销售方式和成交背景3 技术路线与评价指标删除 2 条面积超过 4,000 平方英尺但售价低于 300,000 美元的极端样本后数据按 80% 训练集和 20% 测试集划分。训练目标为 log(1SalePrice)模型比较使用三折 KFold 交叉验证。指标含义解释重点RMSLE对数售价上的均方根误差核心指标越低越好关注相对误差R²模型解释的目标方差比例越接近 1 越好MAE美元口径平均绝对误差便于解释平均偏差金额RMSE美元口径均方根误差对大误差更加敏感MAPE平均绝对百分比误差便于不同价格区间比较4.数据探索4.1高缺失率字段​本案例为保持流程统一在管道中对类别变量使用众数填补进一步优化时可以把这些结构性缺失单独编码为“无”从而保留设施缺失本身的价格信息。4.2 原始售价分布​房价呈明显右偏平均售价约 180,921 美元高于中位数 163,000 美元说明少量高价住宅显著拉高均值。原始偏度约为 1.88。若直接以原始售价训练平方损失会更关注高价房的美元误差模型残差也更容易出现异方差。4.3 对数售价分布​log(1SalePrice) 变换后偏度降至约 0.12分布明显接近对称。对数目标把绝对价格差转换为近似相对差更符合 Kaggle RMSLE 评价口径也能降低少量高价住宅对模型拟合的支配作用。4.4 数值特征相关性​整体质量与售价相关性最高地上居住面积、车库容量、地下室面积、一层面积和建造年份也具有较强正相关。部分变量之间存在明显共线性例如车库容量与车库面积、建造年份与车库年份。岭回归通过 L2 正则化共同收缩相关变量系数适合处理独热编码后的高维设计矩阵。4.5 整体质量与售价​整体质量评分提高时售价中位数持续上升且高分区间的价格增幅更大存在非线性溢价。为增强线性模型表达能力本案例加入 OverallQual 与 GrLivArea 的交互项使“大面积且高质量”的住宅获得额外解释空间。4.6 社区价格差异​社区之间存在明显价格梯度NoRidge、NridgHt 和 StoneBr 等社区的售价中位数处于较高水平。Neighborhood 是名义类别变量不具有自然大小顺序。独热编码能够为每个社区学习独立价格差异并避免序号编码产生虚假的距离关系。4.7 面积与售价及极端样本​5 特征工程与预处理衍生特征计算逻辑作用TotalSF地下室 一层 二层面积综合衡量可使用空间TotalBathrooms全卫浴 0.5×半卫浴统一表示卫浴配置TotalPorchSF各类门廊和木平台面积之和汇总户外空间HouseAge销售年 - 建造年直接表示房龄RemodelAge销售年 - 翻修年表示装修新旧程度TotalQuality整体质量 × 居住面积表达质量与面积交互溢价5.1 多模型比较​中位数基线 RMSLE 超过 0.41明显无法解释住宅差异。随机森林和极端随机树大幅改善但仍不及岭回归。岭回归测试集 RMSLE 为 0.1224、对数尺度 R² 为 0.9112。结果说明高维独热编码后大量类别和数值特征可以通过带正则化的线性组合有效建模。模型交叉验证RMSLE交叉验证R²测试集RMSLE测试集R²岭回归0.11620.91310.12240.9112极端随机树0.12760.89600.13870.8859随机森林0.13500.88320.14060.8827中位数基线0.3970-0.00870.4117-0.00525.2 最终模型指标指标测试集结果RMSLE0.1224对数尺度 R²0.9112美元 MAE14,398.74美元 RMSE19,785.63MAPE8.88%5.3 实际售价与预测售价​大多数样本位于理想预测线附近说明模型能够解释主要价格变化。中低价区间点云更集中高价住宅的预测离散度更大。模型在对数尺度上优化相对误差因此美元绝对误差会随房价提高而自然增加。整体 MAE 约为 14,399 美元MAPE 为 8.88%。5.4 残差诊断​残差总体围绕零线分布没有明显的整体高估或低估但残差振幅随预测价格增加而扩大。高价住宅的稀缺区位、豪华装修和特殊交易可能无法被简单线性关系完全解释。后续可通过梯度提升、模型融合或高价区间专项模型改善尾部表现。5.5 分价格区间误差​分组误差揭示模型在不同价格层级的稳定性。总体指标可能掩盖低价或高价区间的系统偏差因此应同时监控分段 MAPE。5.6 岭回归特征系数​整体质量、总面积、优质厨房或外部装修和高价社区通常表现为正向影响房龄和较差质量类别通常表现为负向影响。独热编码系数是相对于基准类别的条件差异并受到正则化收缩。系数适合解释方向和相对重要性不应直接理解为固定美元增值。6 结论、局限性与改进建议对数变换有效降低售价右偏和异方差是房价建模的关键步骤。整体质量、面积、车库、地下室、年代和社区是核心价格驱动因素。。。。。具体细节见原文创造不易谢谢各位多多点赞收藏
返回列表