乐途乐途
主页
  • 计算机基础

    • TCP/IP
    • Linux
    • HTTP
  • 数据库

    • SQL
    • MySQL 5.7
  • 编程语言

    • C
    • C++
    • Java SE
    • Python2
    • Python3
  • 数据格式

    • JSON
    • XML
  • 认证与安全

    • JWT
  • 工具

    • Markdown
  • Git

    • GitFlow
  • Quartz

    • Quartz
  • Java

    • Maven 入门
    • Maven 进阶
    • MyBatis
    • Spring
    • Spring MVC
  • Java

    • Spring Boot
    • Spring Cloud
    • Spring Cloud Alibaba
    • Spring Security
    • Spring AI
    • Spring Batch
    • Kafka
    • Java 设计模式
  • 缓存

    • Redis
  • 搜索引擎

    • Elasticsearch
  • 分布式协调

    • ZooKeeper
联系
阿里云
主页
  • 计算机基础

    • TCP/IP
    • Linux
    • HTTP
  • 数据库

    • SQL
    • MySQL 5.7
  • 编程语言

    • C
    • C++
    • Java SE
    • Python2
    • Python3
  • 数据格式

    • JSON
    • XML
  • 认证与安全

    • JWT
  • 工具

    • Markdown
  • Git

    • GitFlow
  • Quartz

    • Quartz
  • Java

    • Maven 入门
    • Maven 进阶
    • MyBatis
    • Spring
    • Spring MVC
  • Java

    • Spring Boot
    • Spring Cloud
    • Spring Cloud Alibaba
    • Spring Security
    • Spring AI
    • Spring Batch
    • Kafka
    • Java 设计模式
  • 缓存

    • Redis
  • 搜索引擎

    • Elasticsearch
  • 分布式协调

    • ZooKeeper
联系
阿里云
  • 学习路径
  • 全文搜索与Elasticsearch概述

    • 全文搜索与搜索引擎概述
    • Elasticsearch 与 Lucene 的关系
    • Elasticsearch 核心架构
  • 安装与快速上手

    • 安装 Elasticsearch
    • 快速上手
  • 索引、文档与映射

    • 索引
    • 文档与 CRUD
    • 元数据字段
    • 字段映射
    • 动态映射
    • Reindex 操作
  • 文本分析与分词

    • 倒排索引的构建与原理
    • 分词器组成
    • IK 分词器与自定义词典
    • 近实时搜索原理
    • Ingest Pipeline 数据预处理
  • 搜索基础(Query DSL)

    • match 查询
    • multi_match 多字段查询
    • match_phrase 短语匹配
    • term 与 terms 查询
    • range 范围查询
    • bool 查询
    • 高亮显示与分页
    • 深度分页与遍历
  • 相关性评分与排序

    • BM25 相关性评分
    • 排序与自定义评分
    • Painless 脚本基础
  • 聚合分析(Aggregations)

    • 指标聚合
    • 桶聚合
    • 管道聚合
  • 分布式集群原理

    • 节点与角色
    • 分片与副本
    • 路由
    • 选举与脑裂
    • 快照与恢复
  • 数据建模与最佳实践

    • 索引设计原则与模板
    • 嵌套对象与父子文档
  • 性能优化与运维监控

    • 写入性能优化
    • 搜索性能优化
    • ILM 索引生命周期管理
    • 集群监控与故障排查
  • 面试考点与实战场景

    • 实战案例:课程搜索引擎
    • Elasticsearch 面试考点精选

全文搜索与搜索引擎概述

本章定位:从零理解"搜索"这件事——结构化搜索 vs 全文搜索、搜索引擎发展简史、Elasticsearch 在搜索生态中的位置。


定义与作用

全文搜索(Full-Text Search)是指在大量非结构化或半结构化的文本中,快速查找与搜索词相关的文档,并按相关度排序返回。这与传统数据库的精确查询(WHERE name = '张三')有本质区别。

解决的痛点:数据库的 LIKE '%关键词%' 在大数据量下性能极差(全表扫描),且无法实现分词、相关度排序、模糊匹配和同义词扩展等高级搜索功能。


核心原理:搜索引擎工作流程


完整示例:飞翔科技的搜索需求

场景一:杨英的传统 SQL 困境

运营杨英用 MySQL 管理学生数据,搜索"广东省计算机专业"的学生时遇到问题:

-- ❌ 慢!全表扫描 10 万条
SELECT * FROM students WHERE major LIKE '%计算机%' AND province = '广东';

-- ❌ 更慢!双模糊匹配
SELECT * FROM students WHERE name LIKE '%小%' AND major LIKE '%科学%';

白歌用 Elasticsearch 让她体验毫秒级搜索:

POST /students/_search
{
  "query": {
    "bool": {
      "must": [
        { "match": { "major": "计算机" } }
      ],
      "filter": [
        { "term": { "province": "广东" } }
      ]
    }
  }
}

小结

全文搜索的核心是倒排索引——将"文档→词"的正向映射反转为"词→文档"。搜索引擎的工作流程:文档入库→分词→建倒排索引;搜索时→分词→查倒排索引→评分→排序。ES 在此基础上增加了分布式、高可用和多维度聚合分析能力。

下一页
Elasticsearch 与 Lucene 的关系