当前位置：首页 > news >正文

分布式搜索引擎elasticsearch操作文档操作介绍

news 2026/3/31 11:56:05

1.DSL查询文档

elasticsearch的查询依然是基于JSON风格的DSL来实现的。

1.1.DSL查询分类

Elasticsearch提供了基于JSON的DSL（Domain Specific Language）来定义查询。常见的查询类型包括：

查询所有：查询出所有数据，一般测试用。例如：match_all
全文检索（full text）查询：利用分词器对用户输入内容分词，然后去倒排索引库中匹配。例如：
- match_query
- multi_match_query
精确查询：根据精确词条值查找数据，一般是查找keyword、数值、日期、boolean等类型字段。例如：
- ids
- range
- term
地理（geo）查询：根据经纬度查询。例如：
- geo_distance
- geo_bounding_box
复合（compound）查询：复合查询可以将上述各种查询条件组合起来，合并查询条件。例如：
- bool
- function_score

查询的语法基本一致：

GET /indexName/_search
{"query": {"查询类型": {"查询条件": "条件值"}}
}

我们以查询所有为例，其中：

查询类型为match_all
没有查询条件

  // 查询所有GET /indexName/_search{"query": {"match_all": {}}}

其它查询无非就是查询类型、查询条件的变化。

1.2.全文检索查询

1.2.1.使用场景

全文检索查询的基本流程如下：

对用户搜索的内容做分词，得到词条
根据词条去倒排索引库中匹配，得到文档id
根据文档id找到文档，返回给用户

比较常用的场景包括：

商城的输入框搜索
百度输入框搜索

因为是拿着词条去匹配，因此参与搜索的字段也必须是可分词的text类型的字段。

1.2.2.基本语法

常见的全文检索查询包括：

match查询：单字段查询
multi_match查询：多字段查询，任意一个字段符合条件就算符合查询条件

match查询语法如下：

GET /indexName/_search
{"query": {"match": {"FIELD": "TEXT"}}
}

mulit_match语法如下：

GET /indexName/_search
{"query": {"multi_match": {"query": "TEXT","fields": ["FIELD1", " FIELD12"]}}
}

可以看到，两种查询结果是一样的，为什么？

因为我们将brand、name、business值都利用copy_to复制到了all字段中。因此你根据三个字段搜索，和根据all字段搜索效果当然一样了。

但是，搜索字段越多，对查询性能影响越大，因此建议采用copy_to，然后单字段查询的方式。

1.2.4.总结

match和multi_match的区别是什么？

match：根据一个字段查询
multi_match：根据多个字段查询，参与查询字段越多，查询性能越差

1.3.精准查询

精确查询一般是查找keyword、数值、日期、boolean等类型字段。所以不会对搜索条件分词。常见的有：

term：根据词条精确值查询
range：根据值的范围查询

1.3.1.term查询

因为精确查询的字段搜是不分词的字段，因此查询的条件也必须是不分词的词条。查询时，用户输入的内容跟自动值完全匹配时才认为符合条件。如果用户输入的内容过多，反而搜索不到数据。

语法说明：

// term查询
GET /indexName/_search
{"query": {"term": {"FIELD": {"value": "VALUE"}}}
}

当我搜索的是精确词条时，能正确查询出结果

20210721171655308.png&pos_id=img-4IkqTZJw-1730173977102)

但是，当我搜索的内容不是词条，而是多个词语形成的短语时，反而搜索不到

1.3.2.range查询

范围查询，一般应用在对数值类型做范围过滤的时候。比如做价格范围过滤。

基本语法：

// range查询
GET /indexName/_search
{"query": {"range": {"FIELD": {"gte": 10, // 这里的gte代表大于等于，gt则代表大于"lte": 20 // lte代表小于等于，lt则代表小于}}}
}

1.3.3.总结

精确查询常见的有哪些？

term查询：根据词条精确匹配，一般搜索keyword类型、数值类型、布尔类型、日期类型字段
range查询：根据数值范围查询，可以是数值、日期的范围

1.4.地理坐标查询

所谓的地理坐标查询，其实就是根据经纬度查询，官方文档：https://www.elastic.co/guide/en/elasticsearch/reference/current/geo-queries.html

常见的使用场景包括：

携程：搜索我附近的酒店
滴滴：搜索我附近的出租车
微信：搜索我附近的人

1.4.1.矩形范围查询

矩形范围查询，也就是geo_bounding_box查询，查询坐标落在某个矩形范围的所有文档

查询时，需要指定矩形的左上、右下两个点的坐标，然后画出一个矩形，落在该矩形内的都是符合条件的点。

语法如下：

GET hotel/_search
{"query":{"geo_bounding_box":{"location":{"top_left": {"lat": 31.1,"lon": 121.5},"bottom_right":{"lat": 30.9,"lon": 121.7}}}}
}

这种并不符合“附近的人”这样的需求，所以我们就不做了。

1.4.2.附近查询

附近查询，也叫做距离查询（geo_distance）：查询到指定中心点小于某个距离值的所有文档。

换句话来说，在地图上找一个点作为圆心，以指定距离为半径，画一个圆，落在圆内的坐标都算符合条件

语法说明：

// geo_distance 查询
GET /indexName/_search
{"query": {"geo_distance": {"distance": "15km", // 半径"FIELD": "31.21,121.5" // 圆心}}
}

1.5.复合查询

复合（compound）查询：复合查询可以将其它简单查询组合起来，实现更复杂的搜索逻辑。常见的有两种：

fuction score：算分函数查询，可以控制文档相关性算分，控制文档排名
bool query：布尔查询，利用逻辑关系组合多个其它的查询，实现复杂搜索

1.5.1.相关性算分

当我们利用match查询时，文档结果会根据与搜索词条的关联度打分（_score），返回结果时按照分值降序排列。

例如，我们搜索 “虹桥如家”，结果如下：

[{"_score" : 17.850193,"_source" : {"name" : "虹桥如家酒店真不错",}},{"_score" : 12.259849,"_source" : {"name" : "外滩如家酒店真不错",}},{"_score" : 11.91091,"_source" : {"name" : "迪士尼如家酒店真不错",}}
]

在elasticsearch中，早期使用的打分算法是TF-IDF算法，公式如下：

在这里插入图片描述

在后来的5.1版本升级中，elasticsearch将算法改进为BM25算法，公式如下：

在这里插入图片描述

参考：https://zhuanlan.zhihu.com/p/79202151

TF-IDF算法有一各缺陷，就是词条频率越高，文档得分也会越高，单个词条对文档影响较大。而BM25则会让单个词条的算分有一个上限，曲线更加平滑：

在这里插入图片描述

小结：elasticsearch会根据词条和文档的相关度做打分，算法由两种：

TF-IDF算法
BM25算法，elasticsearch5.1版本后采用的算法

1.5.2.算分函数查询

根据相关度打分是比较合理的需求，但合理的不一定是产品经理需要的。

以百度为例，你搜索的结果中，并不是相关度越高排名越靠前，而是谁掏的钱多排名就越靠前。如图：

在这里插入图片描述

要想认为控制相关性算分，就需要利用elasticsearch中的function score 查询了。

1）语法说明

在这里插入图片描述

function score 查询中包含四部分内容：

原始查询条件：query部分，基于这个条件搜索文档，并且基于BM25算法给文档打分，原始算分（query score)
过滤条件：filter部分，符合该条件的文档才会重新算分
算分函数：符合filter条件的文档要根据这个函数做运算，得到的函数算分（function score），有四种函数
- weight：函数结果是常量
- field_value_factor：以文档中的某个字段值作为函数结果
- random_score：以随机数作为函数结果
- script_score：自定义算分函数算法
运算模式：算分函数的结果、原始查询的相关性算分，两者之间的运算方式，包括：
- multiply：相乘
- replace：用function score替换query score
- 其它，例如：sum、avg、max、min

function score的运行流程如下：

1）根据原始条件查询搜索文档，并且计算相关性算分，称为原始算分（query score）
2）根据过滤条件，过滤文档
3）符合过滤条件的文档，基于算分函数运算，得到函数算分（function score）
4）将原始算分（query score）和函数算分（function score）基于运算模式做运算，得到最终结果，作为相关性算分。

因此，其中的关键点是：

过滤条件：决定哪些文档的算分被修改
算分函数：决定函数算分的算法
运算模式：决定最终算分结果

2）示例

需求：给“如家”这个品牌的酒店排名靠前一些

翻译一下这个需求，转换为之前说的四个要点：

原始条件：不确定，可以任意变化
过滤条件：brand = “如家”
算分函数：可以简单粗暴，直接给固定的算分结果，weight
运算模式：比如求和

因此最终的DSL语句如下：

GET /hotel/_search
{"query": {"function_score": {"query": {  .... }, // 原始查询，可以是任意条件"functions": [ // 算分函数{"filter": { // 满足的条件，品牌必须是如家"term": {"brand": "如家"}},"weight": 2 // 算分权重为2}],"boost_mode": "sum" // 加权模式，求和}}
}

3）小结

function score query定义的三要素是什么？

过滤条件：哪些文档要加分
算分函数：如何计算function score
加权方式：function score 与 query score如何运算

1.5.3.布尔查询

布尔查询是一个或多个查询子句的组合，每一个子句就是一个子查询。子查询的组合方式有：

must：必须匹配每个子查询，类似“与”
should：选择性匹配子查询，类似“或”
must_not：必须不匹配，不参与算分，类似“非”
filter：必须匹配，不参与算分

比如在搜索酒店时，除了关键字搜索外，我们还可能根据品牌、价格、城市等字段做过滤

每一个不同的字段，其查询的条件、方式都不一样，必须是多个不同的查询，而要组合这些查询，就必须用bool查询了。

需要注意的是，搜索时，参与打分的字段越多，查询的性能也越差。因此这种多条件查询时，建议这样做：

搜索框的关键字搜索，是全文检索查询，使用must查询，参与算分
其它过滤条件，采用filter查询。不参与算分

1）语法示例：

GET /hotel/_search
{"query": {"bool": {"must": [{"term": {"city": "上海" }}],"should": [{"term": {"brand": "皇冠假日" }},{"term": {"brand": "华美达" }}],"must_not": [{ "range": { "price": { "lte": 500 } }}],"filter": [{ "range": {"score": { "gte": 45 } }}]}}
}

2）示例

需求：搜索名字包含“如家”，价格不高于400，在坐标31.21,121.5周围10km范围内的酒店。

分析：

名称搜索，属于全文检索查询，应该参与算分。放到must中
价格不高于400，用range查询，属于过滤条件，不参与算分。放到must_not中
周围10km范围内，用geo_distance查询，属于过滤条件，不参与算分。放到filter中

在这里插入图片描述

分布式搜索引擎elasticsearch操作文档操作介绍

1.DSL查询文档 elasticsearch的查询依然是基于JSON风格的DSL来实现的。 1.1.DSL查询分类 Elasticsearch提供了基于JSON的DSL（Domain Specific Language）来定义查询。常见的查询类型包括： 查询所有：查询出所有数据，…...

编程日记 2024/10/29 14:00:31

C++ 中的可调用对象

目录一.可调用对象简介 1.什么是可调用对象？ 2.可调用对象有什么用？ 二.函数指针和仿函数 1.函数指针 a.函数指针的使用语法 b.函数指针的应用场景 2.仿函数 a.仿函数的基本概念 b.仿函数的优点三.lambda表达式和function 1.lambda表达式 …...

编程日记 2024/10/29 13:58:28

[HBase]二 HBase原生Shell命令大全

HBase原生Shell命令汇总 1. General组 5 1.1. 查看集群状态：status 5 1.2. 查看表的操作方法：table_help 5 1.3. 查看HBase的版本信息：version 5 1.4. 查看当前用户：whoami 5 2. Namespace组 5 2.1. 创建命名空间：create_namespace 5 2.2. 显示命名空…...

编程日记 2024/10/29 13:56:25

Kafka之消费者客户端

1、历史上的二个版本与生产者客户端一样，在Kafka的发展过程当中，消费者客户端主要有两个大的版本： 旧消费者客户端（Old Consumer）：基于Scala语言开发的版本，又称为Scala消费者客户端。新消费…...

编程日记 2024/10/29 13:55:23

使用Python进行数据分析入门

文章目录 Python环境搭建安装Anaconda验证安装必备库介绍NumPyPandasMatplotlibSciPy 数据导入与清洗导入数据清洗数据数据探索与分析描述性统计相关性分析数据可视化绘制直方图高级主题机器学习深度学习总结随着大数据时代的到来，数据分析变得越来越重要。Py…...

编程日记 2024/10/29 13:54:21

ubuntu20 从源码编译升级到版本5.15.263

author: hjjdebug date: 2024年 10月 25日星期五 15:38:48 CST description: ubuntu20 从源码编译升级到版本5.15.263 我的内核是 5.15.105, 用apt 下载源码后其版本是5.15.263 为什么要从源码编译内核. 升级内核? 目的: 练练手. 消除内核神秘性. 还可以裁减内核,也是调试内核…...

编程日记 2024/10/29 13:53:20

php 程序开发分层与验证思想

在PHP程序开发中，合理的层级设计可以提高代码的可维护性、可扩展性和可测试性。以下是常见的层级设计模式及建议： 1. 分层架构通常可以将PHP应用分为以下几层： 表示层（Presentation Layer）： 负责与用户交…...

编程日记 2024/10/29 13:49:15

关于InternVL2的单卡、多卡推理

关于InternVL2的单卡、多卡推理前言单卡推理多卡推理总结前言本章节将介绍如何使用上一章节微调后的模型进行推理。推理又分为单卡和多卡，这里介绍的两种方式都是Hugging Face的transformers方法进行推理。模型的话可以使用上一章微调的任意一个非lora模型进行测试。单卡推…...

编程日记 2024/10/29 13:47:02

Go语言设计Web框架

如何设计一个Web框架项目规划在开始设计Web框架之前，我们需要对整个项目进行规划。主要包括以下几个方面： 项目结构依赖管理路由设计控制器设计日志和配置管理项目结构首先，我们定义项目的目录结构： ├── cmd/ │ └…...

编程日记 2024/10/29 13:45:59

2024年10月28日练习（双指针算法）

一.11. 盛最多水的容器 - 力扣（LeetCode） 1.题目描述： 这个题目代表的意思就是数组上每个对应的值就相当于每条垂直线的高度，就相当于短板效应，两个高度的线会取最短的长度因为那样水才不会漏。而两条线的数组的下标…...

编程日记 2024/10/29 13:42:55

Objective-C 音频爬虫：实时接收数据的 didReceiveData_ 方法

在互联网技术领域，数据的获取和处理是至关重要的。尤其是对于音频内容的获取，实时性和效率是衡量一个爬虫性能的重要指标。本文将深入探讨在Objective-C中实现音频爬虫时，如何高效地使用didReceiveData:方法来实时接收数据，并通过…...

编程日记 2024/10/29 13:41:52

提升网站流量和自然排名的SEO基本知识与策略分析

内容概要在当今数字化时代，SEO（搜索引擎优化）成为加强网站可见度和提升流量的重要工具。SEO的基础知识包括理解搜索引擎的工作原理，以及如何通过优化网站内容和结构来提高自然排名。白帽SEO和黑帽SEO代表了两种截然不同的策略&a…...

编程日记 2024/10/29 13:38:48

雷池社区版compose文件配置讲解--fvm

在现代网络安全中，选择合适的 Web 应用防火墙至关重要。雷池（SafeLine）社区版免费切好用。为网站提供全面的保护，帮助网站抵御各种网络攻击。 docker-compose.yml 文件是 Docker Compose 的核心文件，用于定义和管理多…...

编程日记 2024/10/29 13:37:47

基于51单片机的智能断路器proteus仿真

地址： https://pan.baidu.com/s/16lfGgrgVr9V7JehonMNVQA 提取码：1234 仿真图： 芯片/模块的特点： AT89C52/AT89C51简介： AT89C52/AT89C51是一款经典的8位单片机，是意法半导体（STMicroelectro…...

编程日记 2024/10/29 13:36:45

(N-154)基于springboot酒店预订管理系统

开发工具：IDEA 服务器：Tomcat9.0， jdk1.8 项目构建：maven 数据库：mysql5.7 前端技术：AdminLTEBootstrapLayUIHTMLjQuery 服务端技术：springbootmybatis-plusthymeleaf 本项目分前台和后台…...

编程日记 2024/10/29 13:35:43

elasticsearch 8.x 插件安装（三）之拼音插件

elasticsearch 8.x 插件安装（三）之拼音插件 elasticsearch插件安装合集 elasticsearch插件安装（一）之ik分词器安装（含MySQL更新） elasticsearch 8.x插件（二）之同义词安装如何解决…...

编程日记 2024/10/29 13:33:41

快速遍历包含合并单元格的Word表格

Word中的合并表格如下，现在需要根据子类（例如：果汁）查找对应的品类，如果这是Excel表格，那么即使包含合并单元格，也很容易处理，但是使用Word VBA进行查找，就需要一些技巧。…...

编程日记 2024/10/29 13:32:39

手机收银云进销存管理软件，商品档案Excel格式批量导入导出，一键导入Excel的商品档案

如果您有Excel的商品档案，那么就可以批量导入到我们的手机云进销存软件系统里，就不需要人工手工一个个商品的新建商品档案，大大提高工作效率。如果您看下面的步骤不会操作，可以联系我们技术支持，来帮您把商品档案导入。…...

编程日记 2024/10/29 13:31:38

html 中识别\n自动换行

编程日记 2024/10/29 13:30:36

用QWebSocketServer写websocket服务端

1. 引入必要的头文件 #include <QCoreApplication> #include <QWebSocketServer> #include <QWebSocket> #include <QDebug> #include <QObject>QCoreApplication：用于创建控制台应用的事件循环。QWebSocketServer：提供 …...

编程日记 2024/10/29 13:29:35

AsrTools终极指南：三步实现免费语音转文本，效率提升300%的完整方案

编程新知 2026/3/31 11:55:34

Beyond Compare 5 永久激活完全指南：从入门到精通

Beyond Compare 5 永久激活完全指南：从入门到精通【免费下载链接】BCompare_Keygen Keygen for BCompare 5 项目地址: https://gitcode.com/gh_mirrors/bc/BCompare_Keygen 一、问题诊断：Beyond Compare 5授权痛点解析 1.1 评估期结束的功能限制…...

编程新知 2026/3/31 10:00:21

手把手教你为OpenBMC (AST2600平台) 正确配置PCA9545 I2C Switch的DTS节点

深入解析AST2600平台PCA9545 I2C Switch设备树配置实战指南在嵌入式系统开发中，I2C总线扩展是连接多个外设的常见需求。NXP的PCA9545作为一款4通道I2C总线开关芯片，能够有效解决I2C地址冲突问题，但在实际应用中，设备树(DTS)配置…...

编程新知 2026/3/31 9:42:10

Swiper动画进阶：手把手教你用Swiper Animate制作节日主题动画（2023最新版）

Swiper动画进阶：手把手教你用Swiper Animate制作节日主题动画（2023最新版） 当节日氛围遇上交互设计，如何让静态页面"活"起来？Swiper Animate作为Swiper生态中的动画引擎，能通过简单的类名配置实现…...

编程新知 2026/3/31 7:59:26

OpenRGB：开源跨平台RGB灯光控制方案，告别多软件困扰实现设备统一管理

OpenRGB：开源跨平台RGB灯光控制方案，告别多软件困扰实现设备统一管理【免费下载链接】OpenRGB Open source RGB lighting control that doesnt depend on manufacturer software. Supports Windows, Linux, MacOS. Mirror of https://gitlab.com/CalcPr…...

编程新知 2026/3/31 7:19:08

s2-pro实战落地：跨境电商产品介绍多语种语音批量生成

s2-pro实战落地：跨境电商产品介绍多语种语音批量生成 1. 场景痛点与解决方案跨境电商企业面临一个共同挑战：如何高效地为全球不同语言市场的产品生成专业语音介绍。传统方案需要雇佣多语种配音人员，成本高、周期长，且难以保证语…...

编程新知 2026/3/31 7:13:01

S2-Pro自动化运维脚本生成：应对Linux服务器常见管理任务

S2-Pro自动化运维脚本生成：应对Linux服务器常见管理任务 1. 运维工程师的新助手最近遇到个挺有意思的事。我们团队新来的运维小哥，处理服务器问题时总要先翻半天文档，再到处搜脚本模板。看着他手忙脚乱的样子，我突然想起自己刚…...

编程新知 2026/3/31 6:40:48

突破百度网盘限速难题：非会员高速下载的技术实现与实战指南

突破百度网盘限速难题：非会员高速下载的技术实现与实战指南【免费下载链接】baidu-wangpan-parse 获取百度网盘分享文件的下载地址项目地址: https://gitcode.com/gh_mirrors/ba/baidu-wangpan-parse 当你急需下载一份600MB的项目资料，却发现百…...

编程新知 2026/3/31 4:35:16

5分钟解锁网盘直链下载：告别限速，拥抱满速自由

5分钟解锁网盘直链下载：告别限速，拥抱满速自由【免费下载链接】baiduyun 油猴脚本 - 一个免费开源的网盘下载助手项目地址: https://gitcode.com/gh_mirrors/ba/baiduyun 还在为网盘下载速度而烦恼吗？你是否经历过下载一个几GB的文件…...

编程新知 2026/3/31 4:07:03

三极管实战指南：从NPN到PNP，手把手教你识别与使用（附常见误区解析）

三极管实战指南：从NPN到PNP，手把手教你识别与使用（附常见误区解析） 在电子设计的世界里，三极管就像电路中的"水龙头"，控制着电流的流动。无论是简单的LED驱动电路，还是复杂的音频放大…...

编程新知 2026/3/31 3:30:30

1.DSL查询文档

1.1.DSL查询分类

1.2.全文检索查询

1.2.1.使用场景

1.2.2.基本语法

1.2.4.总结

1.3.精准查询

1.3.1.term查询

1.3.2.range查询

1.3.3.总结

1.4.地理坐标查询

1.4.1.矩形范围查询

1.4.2.附近查询

1.5.复合查询

1.5.1.相关性算分

1.5.2.算分函数查询

1）语法说明

2）示例

3）小结

1.5.3.布尔查询

1）语法示例：

2）示例

相关文章：