决策树(Decision trees),是一种逼近离散函数值的方法。它是一种典型的分类方法,首先对 数据进行处理,利用归纳算法生成可读的规则和决策树,然后使用决策对新数据进行分析。本质 上决策树是通过一系列规则对数据进行分类的过程。
决策树算法构造决策树来发现数据中蕴涵的分类规则。如何构造精度高、规模小的决策树是 决策树算法的核心内容。决策树构造可以分两个过程。首先,决策树的生成:由训练样本集生成 决策树的过程。然后,决策树的剪枝:决策树的剪枝是对上一阶段生成的决策树进行检验、校正 和修下的过程,主要是用新的样本数据集(称为测试数据集)中的数据校验决策树生成过程中产 生的初步规则,将那些影响预衡准确性的分枝剪除。
决策树是一个决策支持工具,它用树形的图或者模型表示决策及其可能的后果,包括随机事件的影响、资源消耗、以及用途。比如在解决多源异构的高速铁路车载设备运营维护数据难以统 一和分析的问题中,结合欧洲铁路对运营维护数据所采用的研究方法及国内目前的研究现状,利 用决策树算法,通过对本体规范后的数据集进行训练,构建高速铁路车载设备的智能维护决策树 模型,故障诊断准确率为 95.23%;为了解决普通信息安全风险评估方法主观性大、建模时间长、 分类正确率低的问题,使用了基于决策树的智能信息安全风险评估方法,该方法利用机器学习中 的决策树分类算法对数据进行分类,由于基于决策树的智能信息安全风险评估方法对数据类别分 布无要求,分类正确率提高了 2 倍,且分类速度快;还有就是针对天文恒星/星系分类问题中,决 策树分类算法结合深度学习强大的特征学习能力,再基于 Spark 高效的数据处理性能,体现出了 在恒星星系分类问题上更高的分类准确率,该算法具有很好的可伸缩性,可以通过增加 Spark 集 群计算节点的数量,来减少分类模型所需的训练时间和增强其对海量天文数据的处理能力,并且, 同时具备强大的特征学习和分类能力。




