LDA模型的高效实现方案
发布时间
阅读量:
阅读量
【范涛
发表于2017-04-14
LDA属于一种主题模型,对于多数工业界的技术研发人员而言,LDA往往显得较为难以掌握。尽管LDA所依赖的数学原理相对复杂,但其最终的计算表达式却较为简洁,且具备明确的物理含义。在互联网行业,主题模型被广泛应用于查询语义解析、广告查询与竞价触发匹配等多种文本挖掘场景。当前主流的搜索引擎企业所积累的查询日志数据量极为庞大。如何在如此海量的文本信息中高效地完成主题模型的学习过程,显得尤为重要,这直接决定了主题模型是否能够在实际工业环境中得到有效应用。本文将重点介绍当前业界较为常用的几种快速采样算法,包括Sparse LDA、Alias LDA以及Light LDA(作为知识的传递者和解释者)。
在介绍这些快速采样算法之前,首先简要回顾一下标准Gibbs采样方法在LDA中的相关原理。该方法的时间复杂度为O(K),其中K代表主题的数量(不同主题具有不同的命中概率,在计算过程中需要对累计概率进行归一化处理):

一 Sparse LDA
主要借助LDA模型中所具备的稀疏性特征。在实际应用中,大多数文档通常只涉及
全部评论 (0)
还没有任何评论哟~
