Python实现的随机森林算法与简单总结(python,算法,随机森林,开发技术)

Python实现的随机森林算法与简单总结

导读：本文共4656.5字符，通常情况下阅读需要16分钟。同时您也可以点击右侧朗读，来听本文内容。按键盘←（左） →（右）方向键可以翻页。

摘要：本文实例讲述了Python实现的随机森林算法。分享给大家供大家参考，具体如下：随机森林是数据挖掘中非常常用的分类预测算法，以分类或回归的决策树为基分类器。算法的一些基本要点：*对大小为m的数据集进行样本量同样为m的有放回抽样；*对K个特征进行随机抽样，形成特征的子集，样本量的确定方法可以有平方根、自然对数等；*每棵树完全生成，不进行剪枝；*每个样本的预... ...

音频解说

泰坦尼克号的沉没，是历史上非常著名的海难。突然感到，自己面对的不再是冷冰冰的数据，而是用数据挖掘的方法，去研究具体的历史问题，也是饶有兴趣。言归正传，模型的主要的目标，是希望根据每个乘客的一系列特征，如性别、年龄、舱位、上船地点等，对其是否能生还进行预测，是非常典型的二分类预测问题。数据集的字段名及实例如下：

值得说明的是，SibSp是指sister brother spouse，即某个乘客随行的兄弟姐妹、丈夫、妻子的人数，Parch指parents,children

下面给出整个数据处理及建模过程，基于ubuntu+python 3.4（ anaconda科学计算环境已经集成一系列常用包，pandas numpy sklearn等，这里强烈推荐）

懒得切换输入法，写的时候主要的注释都是英文，中文的注释是后来补充的:-)

上述是随机森林的代码，如上所述，随机森林是一系列决策树的组合，决策树每次分裂，用Gini系数衡量当前节点的“不纯净度”，如果按照某个特征的某个分裂点对数据集划分后，能够让数据集的Gini下降最多（显著地减少了数据集输出变量的不纯度），则选为当前最佳的分割特征及分割点。代码如下：

实际上，上面的代码还有很大的效率提升的空间，数据集不是很大的情况下，如果选择一个较大的输入参数，例如生成100棵树，就会显著地变慢；同时，将预测结果提交至kaggle进行评测，发现在测试集上的正确率不是很高，比使用sklearn里面相应的包进行预测的正确率（0.77512）要稍低一点 :-( 如果要提升准确率，两个大方向：构造新的特征；调整现有模型的参数。

这里是抛砖引玉，欢迎大家对我的建模思路和算法的实现方法提出修改意见。

更多关于Python相关内容感兴趣的读者可查看本站专题：《Python数据结构与算法教程》、《Python编码操作技巧总结》、《Python函数使用技巧总结》、《Python字符串操作技巧汇总》及《Python入门与进阶经典教程》

希望本文所述对大家Python程序设计有所帮助。

本文：Python实现的随机森林算法与简单总结的详细内容，希望对您有所帮助，信息来源于网络。

Python实现的随机森林算法与简单总结(python,算法,随机森林,开发技术)

目录

10 人围观 / 0 条评论 ↓快速评论↓

搜索

最新文章

猜你喜欢

特价优惠

标签

流量统计