Advertisement

jieba的分词原理‖基于前缀词典和动态规划实现的分词方法

阅读量:
  1. jieba分词原理 ‖ 基于前缀词典及动态规划算法的分词机制
  2. jieba分词原理 ‖ 基于HMM模型利用汉字成词机制识别非法词汇的过程
  3. jieba分词原理 ‖ 通过统计分析提取关键词的方法称为关键词抽取技术
  4. jieba分词原理 ‖ 采用统计方法提取文本中的关键信息的技术被称为关键词抽取方法

1 简介

jieba 分割主要以统计为基础,并建立了字典序;随后通过分析各个分割点构建了一个有向无环图;接着应用动态规划算法来确定最高概率的切割序列;最后得出了精确的文本分割结果。

2 实例讲解

以“去北京大学玩”为例,作为待分词的输入文本。

非在线统计的词汇数据库结构如下所示,在每一记录中包含三个字段:第一字段存储词汇信息;第二字段记录词汇出现频率;第三字段标明词汇的语性类别。

复制代码
 ...

    
 北京大学 2053 nt
    
 大学 20025 n
    
 去 123402 v
    
 玩 4207 v
    
 北京 34488 ns
    
 北 17860 ns
    
 京 6583 ns
    
 大 144099 a
    
 学 17482 n
    
 ...

2.1 前缀词典构建

首先是通过统计词典生成前缀词典的过程,在统

全部评论 (0)

还没有任何评论哟~