Advertisement

Elasticsearch入门级 - 分词分析

阅读量:

Analysis与Analyzer功能解析

  • 文本分析指的是将整段文字转化为一系列词语的过程,这一过程也被称为分词
    • 文本分析功能是借助 Analyzer 来达成的

      • 可以使用 Elasticsearch 自带的分析工具,也可以根据实际需求进行自定义分析工具的开发
    • 不仅在数据写入过程中需要对词条进行转换,在匹配 Query 查询语句时同样需要利用相同的分析器对查询内容进行处理

Analyzer 的结构组成

无论是系统预置的还是用户自定义的,都属于一个完整的组件集合,并且包括了 character filters(字符过滤器)、tokenizers(分词器)以及 token filters(标记过滤器)这三个核心组成部分。

字符过滤器(Character filters):字符过滤器以字符流的方式接收原始文本内容,并能够通过增加、删除或修改字符来实现对流的转换。例如,该过滤器可用于将印度-阿拉伯数字(如 ٠ ١٢٣٤٥٦٧٨ ٩)转换为对应的阿拉伯-拉丁数字(如 0123456789),或者从文本中移除 <b> 等 HTML 标签。

一个分析器可以包含零个或多个字符过滤器,并按照顺序依次执行这些操作。

分词器(Tokenizer):分词器接收输入的字符流,将其拆分为独立的标记单元(通常为单个词语),然后输出标记序列

全部评论 (0)

还没有任何评论哟~