数据分析技术中的Apriori算法概述
发布时间
阅读量:
阅读量
Apriori算法作为关联规则挖掘这一核心研究领域的典型代表,被广泛应用于数据挖掘过程中,并位列十大经典数据挖掘算法之中。关联规则挖掘属于数据挖掘学科中具有重要地位的研究方向,其历史可追溯至较早时期,该领域的核心目标在于揭示不同事物之间潜在的内在联系。
关联规则
在阐述Apriori算法之前,有必要先对关联规则进行剖析。
关联规则本质上是一种 X→Y 的逻辑表达形式。当X条件成立时,Y也将随之成立。判断该规则是否有效或成立的核心依据在于支持度与置信度这两个指标。
关于支持度与置信度的定义:<>
支持度用于衡量某条规则在特定数据集中的出现频率,而置信度则用于描述在前提条件满足的前提下,结论成立的可能性大小。
因此,通常情况下,多数关联规则挖掘方法可以划分为两个主要步骤:
(1)频繁项集的生成:识别所有满足最低支持度阈值的项集,并将这些项集定义为频繁项集;
(2)规则的生成:基于上一步所得的频繁项集,进一步提取出具有较高置信度的规则,并将其称为强规则。
在频繁项集生成过程中所消耗的时间通常会超过规则生成所需的时间。
最直观且简单的处理方式是采用暴力搜索策略。
- 构建所有可能存在的关联规则列表(列出全部可能的规则)
- 对每条规则分别计算其对应的支持度与置信度(计算规则的支持度和置信度)
- 将未能通过最小支持度阈
全部评论 (0)
还没有任何评论哟~
