Apriori算法用于关联规则挖掘
发布时间
阅读量:
阅读量
本人所开发的数据挖掘算法相关代码:https://github.com/linyiqun/DataMiningAlgorithm
介绍
Apriori算法作为数据挖掘领域中的经典方法,其名称源自英文"先验"一词,表明该算法具有某种先验特性。这种特性体现为通过前一轮计算结果推导出后续结果的逻辑过程,具体表现将在后续分析中逐步展现。该算法的主要功能是用于发现频繁项集,从直观层面理解,即识别出高频出现的数据组合,并以此为基础最终推导出相应的关联规则。
Apriori算法原理解析
Apriori算法属于一种逐层搜索的迭代型计算方法,其核心在于利用k项集来挖掘(k+1)项集,这一过程依赖于其先验性质:
即所有频繁项集的非空子集也必然是频繁的。
借助该特性,可以对候选集合进行有效的剪枝处理。那么如何由k项集生成(k+1)项集?这正是该算法中最为关键且复杂的一个环节。
整个生成过程主要包含以下两个步骤:
1、连接步骤,即将频繁项与自身进行连接操作。
2、剪枝步骤,剔除候选集中不符合条件的候选项。所谓不符合条件,指的是该候选项的某些子集并非全部为频繁项,必须满足前述先验性质。
此外,仅通过上述两个步骤仍不足以完成候选集的生成,在后续还需依据支持度计数进一步筛选出不满足最低支持度阈值的候选项。
算法实例分析
首先需要考虑的是测试数据:
|
全部评论 (0)
还没有任何评论哟~
