Python数据挖掘 - OneR算法概述
发布时间
阅读量:
阅读量
OneR算法
内容源自《Python数据挖掘入门与实践》一书
Jupyter Notebook安装教程指引
错误率概念解析与参考文献
OneR算法的核心理念较为直观,其分类逻辑基于已有数据中相同特征值的样本最可能归属的类别。该算法名称源于"One Rule",意指在所有特征中挑选出分类性能最优的一个作为判别标准。尽管相较于其他分类方法,OneR的结构显得较为简单,然而在多个实际数据集的应用中,其表现却十分出色。
1.思路解析与方法阐述
在对OneR算法进行阐述时,我们选取了Python编程语言以及广为人知的Iris植物分类数据集作为实现工具和实验样本。
Iris数据集来源与简介
数据集所包含的特征值为连续型数值,而即将采用的算法要求输入为类别型特征,因此必须将连续型数值转换为类别型变量,这一处理步骤被称为离散化(具体实施方式将在后续内容中进行详细说明)。
完成离散化处理后的Iris数据集示例如下
| sepal length | sepal width | petal length | petal width | class |
|---|---|---|---|---|
| 0 | 1 | 0 | 0 | 0 |
| 0 | 0 | 0 | 0 | 0 |
| 0 | 1 | 0 | 0 | 0 |
| … | … | … | … | … |
| 1 | 0 | 1 | 1 | 2 |
| 1 | 1 | 1 | 1 | 2 |
| 1 | 0 |
全部评论 (0)
还没有任何评论哟~
