Advertisement

自然语言处理学习(三):构建中文分词工具

阅读量:

说明

本项目所需的数据资源包括:

  1. dic.xlsx:该文件存储了中文词汇构成的词典,用于作为参考词典使用
  2. 部分单字词的概率值 word_prob 以变量形式提供

基于枚举方法来搭建中文分词工具

复制代码
    import xlrd
    import math
    
    
    # TODO:读取字典。
    print("Reading dic...")
    # 获取一个Book对象
    workbook = xlrd.open_workbook("dic.xlsx")
    
    dic_words = []
    
    # 获取一个sheet对象的列表
    booksheet = workbook.sheet_by_index(0)
    
    rows = booksheet.get_rows()
    for row in rows:
    dic_words.append(row[0].value)
    
    print("len:" + str(len(dic_words)))
    
    # 以下是每一个单词出现的概率。为了问题的简化,我们只列出了一小部分单词的概率。 在这里没有出现的的单词但是出现在词典里的,统一把概率设置成为0.00001
    # 

全部评论 (0)

还没有任何评论哟~