波士顿房价预测实战:从数据预处理到模型优化

发布时间:2026/7/27 8:11:32

波士顿房价预测实战:从数据预处理到模型优化 1. 项目概述波士顿房价预测实战波士顿房价预测是机器学习入门最经典的回归问题之一。我第一次接触这个案例是在研究生阶段的机器学习课程上当时就被它清晰的业务场景和完整的数据结构所吸引。这个项目看似简单却涵盖了数据科学项目全流程数据探索、特征工程、模型选择、训练优化和结果评估。十多年过去了这个案例依然活跃在教学和实践中因为它完美展现了如何用数据驱动的方式解决现实问题。不同于玩具数据集波士顿房价数据包含13个有实际意义的特征如犯罪率、房间数、学区评分等且存在真实的非线性关系和特征相关性非常考验建模者的基本功。提示虽然现在sklearn已移除了原版波士顿房价数据集出于伦理考虑但通过第三方库或调整后的版本仍可获取类似数据。本文代码基于修正后的数据集实现。2. 数据理解与预处理2.1 数据集解析原始数据集包含506条样本每个样本有13个特征和1个目标值房价中位数。这些特征包括CRIM城镇人均犯罪率ZN住宅用地比例INDUS非零售业务用地比例CHAS是否临河1是0否NOX氮氧化物浓度RM平均房间数AGE1940年前建成的自住单位比例DIS到波士顿就业中心的加权距离RAD放射状公路可达性指数TAX每万美元财产税率PTRATIO师生比例B黑人比例已修正LSTAT低收入人群百分比2.2 数据预处理实战import pandas as pd from sklearn.datasets import fetch_openml # 加载修正版数据集 boston fetch_openml(nameboston, version1, as_frameTrue) df pd.DataFrame(boston.data, columnsboston.feature_names) df[PRICE] boston.target # 数据清洗 df df[df[PRICE] 50] # 去除异常值 df[CHAS] df[CHAS].astype(int) # 转换分类变量 # 特征工程 df[ROOM_PER_HOUSE] df[RM] / df[AGE] # 创建新特征 df[LOG_CRIM] np.log(df[CRIM] 1) # 对数变换注意现代实践中应避免直接使用原始数据集中的种族相关特征如B这里仅作演示保留。实际项目中需考虑数据伦理问题。3. 模型构建与训练3.1 基础线性回归模型我们先从最简单的线性回归开始建立基准模型from sklearn.linear_model import LinearRegression from sklearn.model_selection import train_test_split from sklearn.metrics import mean_squared_error # 划分数据集 X df.drop(PRICE, axis1) y df[PRICE] X_train, X_test, y_train, y_test train_test_split(X, y, test_size0.2, random_state42) # 训练模型 lr LinearRegression() lr.fit(X_train, y_train) # 评估 y_pred lr.predict(X_test) mse mean_squared_error(y_test, y_pred) print(f线性回归MSE: {mse:.2f})3.2 高级模型对比尝试更复杂的模型提升效果from sklearn.ensemble import RandomForestRegressor from sklearn.svm import SVR from xgboost import XGBRegressor models { 随机森林: RandomForestRegressor(n_estimators100), 支持向量机: SVR(kernelrbf, C100), XGBoost: XGBRegressor(n_estimators1000, learning_rate0.01) } for name, model in models.items(): model.fit(X_train, y_train) score model.score(X_test, y_test) print(f{name} R2分数: {score:.4f})4. 模型优化与调参4.1 特征重要性分析import matplotlib.pyplot as plt # 随机森林特征重要性 rf RandomForestRegressor() rf.fit(X_train, y_train) plt.figure(figsize(10,6)) plt.barh(X.columns, rf.feature_importances_) plt.title(特征重要性排序) plt.show()4.2 超参数调优使用GridSearchCV进行参数搜索from sklearn.model_selection import GridSearchCV param_grid { n_estimators: [100, 200, 500], max_depth: [None, 5, 10], min_samples_split: [2, 5] } grid GridSearchCV(RandomForestRegressor(), param_grid, cv5) grid.fit(X_train, y_train) print(f最佳参数: {grid.best_params_}) print(f最佳分数: {grid.best_score_:.4f})5. 完整代码实现# 波士顿房价预测完整实现 import numpy as np import pandas as pd from sklearn.datasets import fetch_openml from sklearn.model_selection import train_test_split, GridSearchCV from sklearn.ensemble import RandomForestRegressor from sklearn.metrics import mean_squared_error, r2_score import matplotlib.pyplot as plt # 1. 数据准备 boston fetch_openml(nameboston, version1, as_frameTrue) df pd.DataFrame(boston.data, columnsboston.feature_names) df[PRICE] boston.target # 2. 特征工程 df df[df[PRICE] 50] # 去除异常值 df[LOG_CRIM] np.log(df[CRIM] 1) df[ROOM_PER_TAX] df[RM] / df[TAX] # 3. 数据集划分 X df.drop([PRICE, B], axis1) # 移除敏感特征 y df[PRICE] X_train, X_test, y_train, y_test train_test_split(X, y, test_size0.2, random_state42) # 4. 模型训练与评估 rf RandomForestRegressor(n_estimators200, max_depth10, min_samples_split2) rf.fit(X_train, y_train) # 5. 结果分析 y_pred rf.predict(X_test) print(fMSE: {mean_squared_error(y_test, y_pred):.2f}) print(fR2: {r2_score(y_test, y_pred):.4f}) # 特征重要性可视化 plt.figure(figsize(10,6)) plt.barh(X.columns, rf.feature_importances_) plt.title(特征重要性) plt.show()6. 实战经验与避坑指南6.1 常见问题排查数据泄露确保特征工程步骤在训练集上完成后再应用到测试集避免使用全局统计量过拟合当训练集表现远好于测试集时尝试增加正则化减少特征数量使用交叉验证特征相关性检查特征间的相关系数矩阵避免多重共线性6.2 性能优化技巧增量训练对于大数据集使用warm_startTrue参数逐步增加树的数量早停机制设置early_stopping_rounds防止过拟合并行计算利用n_jobs参数充分利用多核CPU6.3 模型解释性提升import shap explainer shap.TreeExplainer(rf) shap_values explainer.shap_values(X_test) shap.summary_plot(shap_values, X_test)这个SHAP图能直观展示每个特征对预测结果的影响方向和程度比单纯的特征重要性更具解释性。7. 项目扩展方向部署为Web服务使用Flask/FastAPI将模型封装为REST API自动化机器学习尝试AutoML工具如TPOT或Auto-sklearn时间序列预测如果获取到历史房价数据可构建ARIMA或LSTM模型集成学习将多个模型的预测结果进行堆叠(Stacking)我在实际项目中发现加入房屋周边POI兴趣点数据能显著提升预测准确率。比如通过地图API获取到地铁站、商场的距离信息这些特征往往比原始数据中的统计特征更有预测力。

相关新闻