自然语言处理学习(三):构建中文分词工具
发布时间
阅读量:
阅读量
说明
本项目所需的数据资源包括:
- dic.xlsx:该文件存储了中文词汇构成的词典,用于作为参考词典使用
- 部分单字词的概率值 word_prob 以变量形式提供
基于枚举方法来搭建中文分词工具
import xlrd
import math
# TODO:读取字典。
print("Reading dic...")
# 获取一个Book对象
workbook = xlrd.open_workbook("dic.xlsx")
dic_words = []
# 获取一个sheet对象的列表
booksheet = workbook.sheet_by_index(0)
rows = booksheet.get_rows()
for row in rows:
dic_words.append(row[0].value)
print("len:" + str(len(dic_words)))
# 以下是每一个单词出现的概率。为了问题的简化,我们只列出了一小部分单词的概率。 在这里没有出现的的单词但是出现在词典里的,统一把概率设置成为0.00001
#
全部评论 (0)
还没有任何评论哟~
