jieba的分词原理‖基于前缀词典和动态规划实现的分词方法
发布时间
阅读量:
阅读量
- jieba分词原理 ‖ 基于前缀词典及动态规划算法的分词机制
- jieba分词原理 ‖ 基于HMM模型利用汉字成词机制识别非法词汇的过程
- jieba分词原理 ‖ 通过统计分析提取关键词的方法称为关键词抽取技术
- jieba分词原理 ‖ 采用统计方法提取文本中的关键信息的技术被称为关键词抽取方法
1 简介
jieba 分割主要以统计为基础,并建立了字典序;随后通过分析各个分割点构建了一个有向无环图;接着应用动态规划算法来确定最高概率的切割序列;最后得出了精确的文本分割结果。
2 实例讲解
以“去北京大学玩”为例,作为待分词的输入文本。
非在线统计的词汇数据库结构如下所示,在每一记录中包含三个字段:第一字段存储词汇信息;第二字段记录词汇出现频率;第三字段标明词汇的语性类别。
...
北京大学 2053 nt
大学 20025 n
去 123402 v
玩 4207 v
北京 34488 ns
北 17860 ns
京 6583 ns
大 144099 a
学 17482 n
...
2.1 前缀词典构建
首先是通过统计词典生成前缀词典的过程,在统
全部评论 (0)
还没有任何评论哟~
