人工智能-NLP使用TFIDF方法提取文章主题词
发布时间
阅读量:
阅读量
背景
如何提取长文本文章中的核心主题词汇
代码
import jieba
import re
from collections import Counter
from sklearn.feature_extraction.text import TfidfVectorizer
def preprocess_texts(texts, stop_words=None):
"""
对文本列表进行预处理,包括去除空白行、特殊字符,以及使用jieba进行分词。
此外,使用正则表达式去除非中文字符,并移除停用词。
参数:
texts -- 中文文本列表。
stop_words -- 可选,停用词列表。
返回:
返回分词后的语料库列表,其中每个元素是一个字符串,代表一个文档的内容。
"""
# 定义一个正则表达式,匹配中文字符和常用标点符号
pattern = re.compile(r'[\u4e00-\u9fff,。!?、‘’“”()《》]+')
# 移除空白行和只包含空白字符的行
texts = [text for text in texts if text.strip()]
全部评论 (0)
还没有任何评论哟~
