你将学会
- 理解决策树分类与回归的分裂准则原理
- 明确过拟合成因并掌握控制树复杂度手段
- 能独立完成树模型训练与特征重要性分析
- 建立可解释监督学习模型的分析思维
手机阅读
本课程通过鸢尾花与西瓜案例,讲解分类回归决策树分裂准则与剪枝,解决过拟合问题,帮助学习者完成树模型训练可视化,提升结构化建模能力。
作为系列文章的开篇,先帮助读者建立对这类树状预测模型的整体印象,说明它既能解决离散类别的判断问题,也能预测连续数值。文章列出本系列将要覆盖的构建方法、过拟合处理和工具使用等内容,并带领读者搭建好实验所需的虚拟环境与依赖。适合想按部就班入门该算法的人,读完即可准备好后续动手实践的环境。
聚焦分类用途下如何为每个节点挑选最佳切分特征的问题,介绍两种常用的纯度衡量方式,并对比它们的计算特点和默认适用值。文章说明树既可以多叉也通常采用二叉结构,分别讲解基于熵的分裂收益和另一种更简洁的不纯度指标。读完可理解模型是依据什么标准不断二分数据的,明白两种默认切分策略背后的差异与取舍,为读懂源码实现打基础。
在深入原理之前,先让读者从感性层面认识这类模型是如何一步步做出判断的。文章分别用简单例子展示离散分类和连续预测两种情形下树的生长与推理过程,再调用现成工具在经典数据集上完成一次训练并把树状结构直观可视化出来,顺带说明每个节点和分支的含义。读完可对模型的输入输出和整体形态形成印象,为接下来学习分裂准则做铺垫。
分析模型在训练集上表现极好、面对新数据却明显变差这一常见现象,指出完全自由生长的树为何特别容易出现这种问题。文章系统介绍了控制树复杂度的多种手段,包括限制深度、约束节点样本数、限定叶子数量以及事后剪枝等做法。读完可学会用这些手段提升模型的泛化能力,避免一味追求训练准确率而得不偿失。
把视角从原理转向实际开发,逐个讲清主流机器学习库中这类树状模型的常用配置项、可用属性和方法。文章覆盖了分裂准则选择、随机划分策略、深度与样本数限制、考虑特征数量等关键参数,并说明它们各自对模型形态和泛化能力的影响。读完能在调用工具时选对参数,而不是只停留在默认值上,适合上手实战的读者。
面向预测连续数值的情形,说明这类树状模型如何通过不断切分来让每个子集的误差尽可能小。文章先把类别特征转换成数值表示,再演示如何在相邻取值之间寻找候选切分点,并逐一计算不同切分带来的误差下降,最终每个叶子输出该子集的代表值。读者读完能掌握回归型树的构建逻辑,理解它与分类树在优化目标上的不同,以及数据预处理时需要留意的细节。
信息增益是决策树算法中用于特征选择的一个重要指标。在构建决策树时,我们需要确定哪个特征最能有效地分割数据,使得子节点的纯度最高。信息增益就是衡量这种分割能力的指标。 信息增益的计算基于信息熵(或熵)的概念。所以,我们需要了解熵的相关概念、计算方法,以及如何基于这些概念来构建分类决策树。 1. 信息熵 信息熵是信息论中一个重要的概念,由克劳德·香农在 1948 年引入,并被广泛应用于通信、数据压缩、统计学等领域,它是用于描述信息的不确定性、信息的容量、信息的不纯度。 如何去度量一个变量的信息熵? 假设:我们有变量 X 和 Y,其值如下表所示: 我们使用上述公式计算得到 X 和 Y 的信息熵如下:...
基尼指数是决策树算法中用于评估特征分裂质量的一个关键指标,分裂后子节点的基尼指数越低,表示子节点的纯净度越高。 1. 基尼不纯度 基尼不纯度(Gini impurity)是衡量变量不纯度的一个指标。基尼不纯度越高,表示数据的不纯度或混乱程度越大。计算公式: 其中, 是数据集 中属于第 类的样本占总样本数的比例, 是类别的数量。 变量 X 变量 Y α A α A β B α A β B α B 我们使用上面的公式来计算变量 X 和 Y 的不纯度: 从计算结果来看,变量 Y 的基尼不纯度要高于 X。 2. 基尼指数 在决策树的构建过程中,我们需要选择一个特征和一个切分点来分割数据集。为了找到最...
在 scikit-learn 的决策树实现中,使用 CCP(Cost-Complexity Pruning)代价复杂度剪枝,用于避免过拟合并提高决策树的泛化能力。 1. 剪枝原理 决策树中包含了很多子树,一棵子树是否应该剪掉,得通过某个指标来对其代价复杂度进行度量,CCP 使用下面的指标来进行度量: 通过 CCP 公式,我们可以从不纯度和叶子结点数量两个角度来度量一棵树的复杂度。其中,不纯度表示树的拟合效果,叶子结点数量表示树的复杂度。 在公式中,超参数 α 用来调节度量决策树代价复杂度时,我们更倾向于关心不纯度,还是叶子结点数量: 另外,我们还需要理解一点是:树的剪枝过程并不是只剪一次,如果...