Elasticsearch入门级 - 分词分析
发布时间
阅读量:
阅读量
Analysis与Analyzer功能解析
- 文本分析指的是将整段文字转化为一系列词语的过程,这一过程也被称为分词
-
文本分析功能是借助 Analyzer 来达成的
- 可以使用 Elasticsearch 自带的分析工具,也可以根据实际需求进行自定义分析工具的开发
-
不仅在数据写入过程中需要对词条进行转换,在匹配 Query 查询语句时同样需要利用相同的分析器对查询内容进行处理
-
Analyzer 的结构组成
无论是系统预置的还是用户自定义的,都属于一个完整的组件集合,并且包括了 character filters(字符过滤器)、tokenizers(分词器)以及 token filters(标记过滤器)这三个核心组成部分。
字符过滤器(Character filters):字符过滤器以字符流的方式接收原始文本内容,并能够通过增加、删除或修改字符来实现对流的转换。例如,该过滤器可用于将印度-阿拉伯数字(如 ٠ ١٢٣٤٥٦٧٨ ٩)转换为对应的阿拉伯-拉丁数字(如 0123456789),或者从文本中移除 <b> 等 HTML 标签。
一个分析器可以包含零个或多个字符过滤器,并按照顺序依次执行这些操作。
分词器(Tokenizer):分词器接收输入的字符流,将其拆分为独立的标记单元(通常为单个词语),然后输出标记序列
全部评论 (0)
还没有任何评论哟~
