Advertisement

统计角色出场频率

阅读量:
复制代码
    import jieba, re
    jieba.load_userdict("newdit.txt")  # 因为是该文章是翻译过来的,人名会有‘·’故为人名加入字典
    jieba.re_han_default = re.compile("(.+)", re.U)  # 可以使自定义词典含有特殊符号
    final = []  # 构建空列表用于放所有的词(要处理的文章)
    filename = "moon.txt"  # 文件目录
    stop = []  # 空列表用于存放停用词
    stopName = "stopWords.txt"
    newName = "newdit.txt"
    newdn = []  # 空列表用于存放自定义词
    counts = {}  # 空字典用来记录不含名字的每个词在文章的的频数
    counts1={}   #空字典用来记录名字在文章的的频数
    people = []  #记录名字
    combine_dict = {} #同义词的词典{a的同义词1:a,a的同义词2:a,b的同义词1:b.....}这种结构
    for line in open("tongyici.txt", "r", encoding='utf-8'):  #生成同以词字典
    simi

全部评论 (0)

还没有任何评论哟~