Advertisement

人工智能-NLP使用TFIDF方法提取文章主题词

阅读量:

背景

如何提取长文本文章中的核心主题词汇

代码

复制代码
    import jieba
    import re
    from collections import Counter
    from sklearn.feature_extraction.text import TfidfVectorizer
    
    def preprocess_texts(texts, stop_words=None):
    """
    对文本列表进行预处理,包括去除空白行、特殊字符,以及使用jieba进行分词。
    此外,使用正则表达式去除非中文字符,并移除停用词。
    
    参数:
    texts -- 中文文本列表。
    stop_words -- 可选,停用词列表。
    
    返回:
    返回分词后的语料库列表,其中每个元素是一个字符串,代表一个文档的内容。
    """
    # 定义一个正则表达式,匹配中文字符和常用标点符号
    pattern = re.compile(r'[\u4e00-\u9fff,。!?、‘’“”()《》]+')
    
    # 移除空白行和只包含空白字符的行
    texts = [text for text in texts if text.strip()]

全部评论 (0)

还没有任何评论哟~