Elasticsearch “指纹”去重机制,你实践中用到了吗?

0、实战问题

f89f71ef591d78be80673725e5b08e61.png

老师有个问题想请教一下,我们项目中有个需求是查询出数据集根据某个字段去重后的全部结果,用 collapse 发现很多数据都没查询到,后面发现是去重的这个字段的值太长了,ignore _above默认的是256,而这个字段的值有的有十几万甚至几十万个字符,像这种情况,还有什么比较好的查询去重方法吗?

——来自:死磕Elasticsearch知识星球 

https://t.zsxq.com/15t8cCz6s

1、之前有讲述logstash fingerprint filter 去重

参见:fingerprint filter 插件——Elasticsearch 去重必备利器

那么有没有其他的实现方式呢?

2、 fingerprint processor 实现去重

2.1.1 fingerprint processor定义

在 Elasticsearch 中,Fingerprint(指纹)通常指的是一种机制,用于为数据生成一个唯一的标识符或指纹。这个指纹是基于数据内容的一个哈希值,可用于识别和区分数据项。

079f988a1834a01ab76660efda243929.png

2.1.2 fingerprint processor产生背景

在处理大量数据时,尤其是在日志聚合或数据索引的场景中,去重变得非常重要。

Fingerprint 可以帮助识别重复的数据。通过对数据生成指纹,可以确保数据在传输或处理过程中的完整性。

2.1.3 fingerprint processor 用途

  • 唯一标识: 用于给数据生成一个唯一标识,以便跟踪和管理。

  • 数据对比: 通过比较不同数据的指纹,可以快速判断它们是否相同。

  • 安全性和合规: 在安全性和合规性要求高的场景下,用于确保数据的一致性和完整性。

2.1.4 fingerprint processor使用详解

### 定义finger_print processor
PUT _ingest/pipeline/fp_processor
{
  "processors": [
    {
      "fingerprint": {
        "fields": [
          "content"
        ]
      }
    }
  ]
}

### 创建索引
DELETE news_index
PUT news_index
{
  "settings": {
    "default_pipeline": "fp_processor"
  },  "mappings": {
    "properties": {
      "content": {
        "type": "text"
      }
    }
  }
}

### 批量写入数据
PUT news_index/_bulk
{"index":{"_id":1}}
{"content":"雷军:小米汽车正在试产爬坡阶段,定价“有理由的贵”"}
{"index":{"_id":2}}
{"content":"雷军剧透小米汽车发布会:对标保时捷、特斯拉 定价有点贵身"}
{"index":{"_id":3}}
{"content":"雷军:小米汽车正在试产爬坡阶段,定价“有理由的贵”"}

### 执行检索
POST news_index/_search

召回结果如下:

1df68a3abf07d3ca03649a5bc917fd36.png

注意:

  • 由于_id为1和_id 为3 的两个 content 一致,所以它们的 fingerprint 也是一致的。

  • 这样就可以再基于 fingerprint 字段实现 collapse 操作就可以很好的实现去重了。

3、关于 fingerprint,还有分词器

关于 Elasticsearch 中的 Fingerprint 分析器(或者称为分词器),一个常见且易于理解的应用场景是在数据清洗过程中用于识别和合并重复的记录。

例如,考虑一个包含用户信息的数据集,其中由于录入错误或不一致的格式,同一用户的多个记录可能以略微不同的方式出现。使用 Fingerprint 分析器,我们可以生成每条记录的唯一指纹,从而轻松识别和合并这些重复的记录。

参见下面的真实举例,在地址或人名数据的去重中,Fingerprint 分析器可以帮助识别本质上相同但表述略有差异的记录。

3.1 fingerprint 分词器使用场景示例

假设我们有一个包含人名的数据集,由于不同的输入习惯,同一个人名可能有不同的表述方式,比如:

"John Smith"
"smith, john"
"John Smith" (多个空格)

虽然这些记录代表同一个人,但由于格式和空格的差异,它们可能被视为不同的记录。

扩展场景:

  • 数据聚类: 通过创建文本的“指纹”,可以更容易地识别和聚集相似或重复的条目。

  • 数据清洗和去重: 在大型数据集中识别和合并重复或相似的记录。

  • 文本分析: 提供一种标准化和简化的文本表示,有助于后续的文本分析和处理。

3.2  使用 Fingerprint 分析器详解

a40afcadb70e26f45e4c3c523afc7a15.jpeg

为了标准化并识别这些记录,我们可以在 Elasticsearch 中定义一个使用 Fingerprint 分析器的索引。

以下是完整的 DSL 示例:

PUT my_index
{
  "settings": {
    "analysis": {
      "analyzer": {
        "my_fingerprint_analyzer": {
          "type": "fingerprint",          "stopwords": "_english_"
        }
      }
    }
  },  "mappings": {
    "properties": {
      "name": {
        "type": "text",        "analyzer": "my_fingerprint_analyzer"
      }
    }
  }
}

POST my_index/_bulk
{"index":{"_id":1}}
{"name": "John Smith"}
{"index":{"_id":2}}
{"name": "smith, john"}
{"index":{"_id":3}}
{"name": "John    Smith"}

如上DSL 解读如下:在 settings 下定义了一个自定义的分析器 my_fingerprint_analyzer,它使用 Elasticsearch 的 Fingerprint 分析器类型,并配置了英语停用词列表。

"stopwords": "english" 是指在使用某些文本分析器(比如 Fingerprint 分析器)时,应用预定义的英语停用词列表。

停用词是在文本处理中通常被排除的词汇,因为它们过于常见而且通常不携带重要的含义或信息,比如 "the","is","at","which" 等。

POST my_index/_search


POST my_index/_analyze
{
  "text": [
    "John Smith",    "smith, john",    "John    Smith"
  ],  "field": "name"
}

执行结果如下:

cae463f3c962f496c93ad701a330379c.png

3.3 Fingerprint 分析器工作原理

从上面的结果不难看出,即使上述三条记录在某些细节上不同,它们也会生成相同的指纹,从而可以被识别为代表同一用户的记录。

尤其:"smith,john" 也会做字母排序处理,变成“john smith”。

通过这种方式,Fingerprint 分析器帮助我们识别和合并数据集中的重复记录,从而提高数据的一致性和准确性。

Fingerprint 分析器可实现功能列表如下:

  • 转换为小写(Lowercased):

将输入文本中的所有字符都被转换为小写,这有助于确保文本处理不受字母大小写的影响,提高数据的一致性。比如,前文中的“john smith”就是例证。

  • 标准化移除扩展字符(Normalized to Remove Extended Characters):

文本中的扩展字符(如重音符号或其他非标准ASCII字符)被转换或移除。这一步骤有助于统一不同格式或编码方式的文本。

  • 排序(Sorted):

文本中的单词(或标记)被按字典顺序排序。排序后,相同的单词组合(无论原始顺序如何)将被视为相同,有助于数据聚类和去重。

  • 去重(Deduplicated):

重复的单词或标记在排序后被移除。这减少了数据的冗余性,使每个文本的表示更加紧凑和唯一。

  • 合并成单个标记(Concatenated into a Single Token):

经过上述处理后的单词或标记被合并成一个单一的长字符串标记。这样做的目的是创建一个独特的“指纹”,用于表示原始文本。

  • 停用词移除(Stop Words Removal,如果配置了停用词列表):

如果配置了停用词列表,那么常见的停用词(如“the”,“is”,“at”等)将从文本中移除。停用词通常在文本分析中被忽略,因为它们过于常见且不携带特定信息。——比如咱们前面用到的"stopwords": "english"。

继续举例子看一下:

POST my_index/_analyze
{
  "text": [
    "the the skiing center of the U.S.; If you're going to work hard, now is the time."
  ],  "field": "name"
}

执行结果如下:

{
  "tokens": [
    {
      "token": "center going hard now skiing time u.s work you're",      "start_offset": 0,      "end_offset": 81,      "type": "fingerprint",      "position": 0
    }
  ]
}

5cefd034a02c18d8a72db2cf43486189.png

  • 去掉了:“the”、“to”、“is”等停用词;

  • 大写转成小写;

  • 按照字母顺序排序。

4、fingerprint 那么多,如何选型?

一句话:

  • 如果目的是改进搜索和索引,选择 Fingerprint 分词器,在创建索引的 settting 阶段指定。

  • 如果是数据预处理和清洗,选择 Fingerprint Processor。在创建索引的 default_pipeline 指定为上策。

  • 如果在 Logstash 管道中处理日志和事件数据,选择 Fingerprint Logstash 过滤处理器

还有,如果涉及大文本去重、聚合相关操作,推荐将 fingerprint 用起来!

推荐阅读

  1. 全网首发!从 0 到 1 Elasticsearch 8.X 通关视频

  2. 重磅 | 死磕 Elasticsearch 8.X 方法论认知清单

  3. 如何系统的学习 Elasticsearch ?

  4. 2023,做点事

  5. Elasticsearch 6.X 去重详解

f7daca74a9b2ebf7cdba5e340ef0b5e2.jpeg

更短时间更快习得更多干货!

和全球 近2000+ Elastic 爱好者一起精进!

ac6d0a06e9aaa428ffc1511750e0efbe.gif

比同事抢先一步学习进阶干货!

原文地址:https://blog.csdn.net/laoyang360/article/details/135259692

版权声明:本文内容由互联网用户自发贡献,该文观点与技术仅代表作者本人。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如发现本站有涉嫌侵权/违法违规的内容, 请发送邮件至 dio@foxmail.com 举报,一经查实,本站将立刻删除。

相关推荐


文章浏览阅读774次,点赞24次,收藏16次。typescript项目中我们使用typings-for-css-modules-loader来替代css-loader实现css modules。1、typings-for-css-modules-loader加载器介绍 Webpack加载器,用作css-loader的替代产品,可动态生成CSS模块的TypeScript类型这句话是什么意思呢?就是编译时处理css文件...
文章浏览阅读784次。react router redux antd eslint prettier less axios_react+antd+redux+less
文章浏览阅读3.9k次,点赞5次,收藏11次。需要删除.security-7索引文件。把在第1步中的被注释的配置打开。之后就是按照提示输入密码。执行bin目录下的文件。_failed to authenticate user 'elastic' against
文章浏览阅读1.2k次,点赞23次,收藏24次。Centos 8 安装es_centos8 yum elasticsearch
文章浏览阅读3.2k次。设置完之后,数据会⾃动同步到其他节点。修改密码时,将第⼀步配置删除,然后重启。单独使⽤⼀个节点⽣成证书;执⾏设置⽤户名和密码的命令。执⾏完上⾯命令以后就可以在。⽂件,在⾥⾯添加如下内容。这个⽂件复制到其他节点下。其中⼀个节点设置密码即可。依次对每个账户设置密码。全部节点都要重启⼀遍。需要在配置⽂件中开启。个⽤户分别设置密码,⽬录下,证书⽂件名为。功能,并指定证书位置。_es设置账号和密码
文章浏览阅读1.9k次,点赞2次,收藏7次。针对多数据源写入的场景,可以借助MQ实现异步的多源写入,这种情况下各个源的写入逻辑互不干扰,不会由于单个数据源写入异常或缓慢影响其他数据源的写入,虽然整体写入的吞吐量增大了,但是由于MQ消费是异步消费,所以不适合实时业务场景。不易出现数据丢失问题,主要基于MQ消息的消费保障机制,比如ES宕机或者写入失败,还能重新消费MQ消息。针对这种情况,有数据强一致性要求的,就必须双写放到事务中来处理,而一旦用上事物,则性能下降更加明显。可能出现延时问题:MQ是异步消费模型,用户写入的数据不一定可以马上看到,造成延时。_mysql同步es
文章浏览阅读3.6w次,点赞48次,收藏44次。【程序员洲洲送书福利-第十九期】《C++ Core Guidelines解析》
文章浏览阅读1.3k次。当我们在开发Vue应用时,经常需要对表单进行校验,以确保用户输入的数据符合预期。Vue提供了一个强大的校验规则机制,通过定义rules规则,可以方便地对表单进行验证,并给出相应的错误提示。_vue ruler校验
文章浏览阅读2k次,点赞16次,收藏12次。Linux内核源码下载地址及方式_linux源码下载
文章浏览阅读1k次。这样在每天自动生成的索引skywalking_log_xxx就会使用上述模版来生成,timestamp会被设置成date类型。然后此时在–>索引管理–>kibana–>索引模式添加skywalking_log*索引时就会有时间字段了。在通过skywalking将日志收集到es后,由于skywalking收集的日志(skywalking_log索引)没有date类型的字段导致在es上再索引模式中没有时间范围的查询。skywalking收集的日志有时间戳字段timestamp,只是默认为long类型。_skywalking timestamp
文章浏览阅读937次,点赞18次,收藏21次。1.初始化git仓库,使用git int命令。2.添加文件到git仓库,两步走:2.1 使用命令,注意,可反复多次使用,添加多个文件;2.2 使用命令,完成。此笔记是我个人学习记录笔记,通过廖雪峰的笔记进行学习,用自己能理解的笔记记录下来,如果侵权,联系删。不存在任何盈利性质,单纯发布后,用于自己学习回顾。
文章浏览阅读786次,点赞8次,收藏7次。上述示例中的 origin 是远程仓库的名称,https://github.com/example/repository.git 是远程仓库的 URL,(fetch) 表示该远程仓库用于获取更新,(push) 表示该远程仓库用于推送更新。你可以选择在本地仓库创建与远程仓库分支对应的本地分支,也可以直接将本地仓库的分支推送到远程仓库的对应分支。将 替换为远程仓库的名称(例如 origin), 替换为要推送的本地分支的名称, 替换为要推送到的远程分支的名称。_git remote 智能切换仓库
文章浏览阅读1.5k次。配置eslint校验代码工具_eslint 实时校验
文章浏览阅读1.2k次,点赞28次,收藏26次。Git入门基础介绍,什么是Git,如何使用Git,以及Git的工作的基本原理
文章浏览阅读2.7k次。基于官方给出的几种不同环境不同的安装方式,本文将会选择在使用.zip文件在Windows上安装Elasticsearch在Linux或macOS上从存档文件安装ElasticsearchInstall Elasticsearch with Docker (此种方式待定)使用Docker安装Elasticsearch。_elasticsearch安装部署windows
文章浏览阅读3.3k次,点赞5次,收藏11次。【Linux驱动】内核模块编译 —— make modules 的使用(单模块编译、多模块编译)_make modules
文章浏览阅读1k次。docker启动es报错_max virtual memory areas vm.max_map_count [65530] is too low, increase to at
文章浏览阅读4.2k次,点赞2次,收藏6次。使用docker单机安装elasticsearch后再安装kibana时找不到es。_unable to retrieve version information from elasticsearch nodes. security_ex
文章浏览阅读1.1k次。日志处理对于任何现代IT系统都是关键部分,本教程专为新手设计,通过详细解释Logstash的三大核心组件,为您展示如何从零开始搭建强大的日志处理系统。您还将学习如何同步MySQL数据到Elasticsearch,并通过一个"Hello World"示例快速入门。无论您是完全的新手还是有一些基础,本教程都将引导您顺利掌握Logstash的基本操作和高级应用。_logstash mysql
文章浏览阅读1.1w次,点赞5次,收藏25次。执行这条指令之后,你的本地项目就与远程Git仓库建立了连接,你就可以开始对你的代码进行版本追踪和协作开发了。使用“git remote add origin”指令,可以轻松地将本地项目连接到远程Git仓库。git remote set-url origin 执行这条指令之后,Git就会将已经添加的名为“origin”的仓库删除。git remote add origin 其中,是你的远程Git仓库的网址。_git remote add origin