Elasticsearch入门 - 功能特点介绍

功能

1. 分布式的搜索引擎和数据分析引擎

搜索引擎: 比如我们常用的百度,以及其他网站的站内搜索,文献检索。

数据分析: 各大电商网站,比如某宝,某东,他们会分析最近几天某种商品销量排名,还有一些新闻网站,最近 1 个月访问量排名前 3 的新闻版块是哪些。

2. 全文检索,结构化检索,数据分析

我们可以拿 mysql 数据库举例来说明这些概念

  • 全文检索:我想搜索商品名称包含牙膏的商品,

      select * from products where product_name like "%牙膏%"
    
  • 结构化检索:我想搜索商品分类为日化用品的商品都有哪些。

      select * from products where category_id="日化用品"
    
  • 部分匹配、自动完成、搜索纠错、搜索推荐

  • 数据分析:我们分析每一个商品分类下有多少个商品

      select category_id,count(*) from products group by category_id
    

3. 对海量数据进行近实时的处理

  • 分布式

    Elasticsearch 会自动将海量数据分散到多台服务器上去存储和检索海量数据的处理

  • 近实时

    在对数据进行搜索和分析时花费的时间为秒级别

而 lucene 只能在单台服务器上使用,最多只能处理单台服务器可以处理的数据量。

使用场景

  • GitHub

    搜索上千亿行代码

  • 电商网站

    检索商品

  • 日志数据分析

    ELK (elasticsearch+logstash+kibana)日志采集,logstash采集日志,ES进行复杂的数据分析

  • 其他 站内搜索(电商,招聘网站,门户网站)

特点

(1)可以作为一个大型分布式集群(数百台服务器)技术,处理PB级数据,服务大公司;也可以运行在单机上,服务小公司

(2)Elasticsearch不是什么新技术,主要是将全文检索、数据分析以及分布式技术,合并在了一起,才形成了独一无二的ES;lucene(全文检索),商用的数据分析软件(也是有的),分布式数据库(mycat)

(3)对用户而言,是开箱即用的,非常简单,作为中小型的应用,直接3分钟部署一下ES,就可以作为生产环境的系统来使用了,数据量不大,操作不是太复杂

(4)数据库的功能面对很多领域是不够用的(事务,还有各种联机事务型的操作);特殊的功能,比如全文检索,同义词处理,相关度排名,复杂数据分析,海量数据的近实时处理;Elasticsearch作为传统数据库的一个补充,提供了数据库所不不能提供的很多功能