Advertisement

基于BILSTM与CRF结合的NLP实体识别技术

阅读量:
复制代码
    """
    NLP命名体识别bilstm+crf
    1、准备数据:origin_handle_entities()
    读取源数据文件,把人名,地名,机构名合并起来
    
    2、读取处理后的数据:origin_handle_mark()
    把预处理后的的文本标注成BMO的格式,
    B(begin)、M(middle)、E(end)、O(other)
    
    3、句子切分:sentence_split()
    按照指定的格式,比如标点等内容对数据完成切分
    4、保存数据
    a.将标注的句子拆分自成列表和对应的标注序列
    b.创建词汇表和标签
    c.文本的向量化表示
    d.划分训练集和测试集
    e.保存成二进制pkl文件
    5、加载数据
    6、训练模型BiLSTM&HMM
    7、保存训练后的模型用于预测
    8、预测
    """
    import codecs
    import re
    import collections
    import pickle
    
    import TorchCRF as CRF
    import numpy as np
    
    from tensorflow.keras.preproces

全部评论 (0)

还没有任何评论哟~