Advertisement

数据挖掘应用Apriori算法

阅读量:

Apriori算法

Apriori算法是一种用于挖掘关联规则的计算方法,由Agrawal等人提出,该方法基于两阶段挖掘策略,并通过多次扫描事务数据库来实现。在设计上,该算法可以划分为两个主要步骤进行操作:

1、从给定的事务数据库(D)中提取所有频繁项集。

那些支持度超过设定的最小支持度阈值minSup的项集被定义为频繁项集(Frequent Itemset)。首先需要识别出所有的频繁1-项集;随后,通过递推的方式继续寻找更高阶的频繁k-项集(k>1)。具体实现方式如下:在生成候选频繁k-项集(Ck)之后,依据最小支持度minSup进行筛选,从而确定最终的频繁k-项集。最后将所有不同阶数的频繁k-项集进行整合。

关于挖掘频繁项集的具体步骤描述如下:

(1) L1 = find_frequent_1-itemsets(D); // 首先获取所有频繁1-项集,此过程相对简单
(2) for (k=2;Lk-1 ≠Φ ;k++) {
(3) Ck = apriori_gen(Lk-1 ,min_sup); // 调用apriori_gen函数生成候选的频繁k-项集
(4) for each transaction t ∈ D { // 对事务数据库D进行扫描
(5) Ct = subset(Ck,t);
(6) for each candidate

全部评论 (0)

还没有任何评论哟~