机器学习系列手记(六):概率图模型之主题模型
发布时间
阅读量:
阅读量
概率图模型
主题模型
基于词袋模型或N-gram模型构建的文本标识系统存在明显局限性,在于它无法有效识别两个不同词汇项或短语组在主题层面上具有等价性;因此形成了特殊的主题建模技术。该技术能够将具有相同主题意义的词汇项与短语组映射至同一潜在维度空间中;通过分析文档内关键词项之间的共现概率关系来判断两个不同词汇是否属于同一类别的隐性语义空间结构。具体而言,在假定存在K个独立的主题类别的情况下;我们可以通过对大规模文档库进行建模来估计每个文档在各个潜在类别的条件概率分布;最终得到的是一个K维的主题向量表示;其中每个维度代表一个独立的主题类别,并赋予该值表示文章在该主题类别上的隶属程度;而这种隶属程度则是通过计算文档内关键词项之间的共现概率关系来确定的;其主要功能在于从大规模文本库中提取具有代表性的话题,并推断每个话题对应的词汇分布情况。
1、常见的主题模型及其原理
(1)pLSA

基于特定的概率分布规则进行的主题z与词w的生成过程。假定在文章d中出现主题z的概率为p(z|d)。那么,在选定主题的情况下生成词w的概率即为 p(w|z) ,因
全部评论 (0)
还没有任何评论哟~
