Advertisement

Hadoop实现关联规则算法二项集挖掘

阅读量:

最近在研读mahout关联规则相关的源代码时,感到相当困惑。起初计划撰写一系列文章,对关联规则的源码进行深入解析,但随后发现内容较为杂乱,可能是因为整体结构较为复杂,因此决定先尝试实现最为基础的二项集关联规则。所采用的算法思路依旧参考了之前的示意图:

该过程共包含五个阶段:

  1. 统计原始输入中各个元素的出现频率;
  2. 根据出现频率由高至低(剔除频率低于设定阈值的元素)生成frequency list文件;
  3. 基于frequency list文件对原始事务数据进行排序并实施剪枝处理;
  4. 构建二元组规则;
  5. 统计二元组规则的出现次数,并移除未达到阈值的二元组规则;

第一阶段的具体实现涵盖步骤1与步骤2,相关代码如下:

GetFlist.java:

复制代码
 package org.fansy.date1108.fpgrowth.twodimension;

    
  
    
 import java.io.BufferedReader;
    
 import java.io.IOException;
    
 import java.i

全部评论 (0)

还没有任何评论哟~