
我们可以通过随机抽样创建新的训练集从而创建数集成这将为我们创建随机森林打下基础随机森林是一种很强大的算法其效果远远使用单一的决策树我们有一个样本我们呢对这个样本进行有放回抽样创建多个样本然后将在这些样本中训练决策树我们对总样本进行不放回抽样然后再根据抽样的数据构建决策树,就这样一直重复有了各种各样的树但是有一种特例就是有时根节点还有根节点周围的节点选择的特征比较相似我们应该怎么处理呢因此算法还有一个修改的版本尽可能的在每一个节点上随机化特征选择这使得学习树变得更加不同从而在投票的时候获得更精准的预测通常情况是在每个节点中选择一个特征进行分裂如果有N个特征可用我们不是在n个特征中去选择我们会选择一个随机的子集K并允许算法从K个特征的子集中选择当数据集很大的时候K一般选择 N的平方根这种一般用在大规模的数据集中通过进一步的选择我们最终会得到随机森林算法随机森立比一棵树更鲁棒更准确对数据不敏感每个树都不同采用投票的方式还有一种算法表现的更好那就是 提升决策树XGBost