搜索引擎检索系统概述_威海佰年网络技术有限公司_网站建设_软件开发_私有云_商标注册_公众号_小程序_APP_物联网

搜索引擎检索系统概述

前面简要介绍过了搜索引擎的索引系统，实际上在建立倒排索引的最后还需要有一个入库写库的过程，而为了提高效率这个过程还需要将全部term以及偏移量保存在文件头部，并且对数据进行压缩，这涉及到的过于技术化在此就不多提了。今天简要给大家介绍一下索引之后的检索系统。

检索系统主要包含了五个部分，如下图所示：

索引&检索.jpg

（1）Query串切词分词即将用户的查询词进行分词，对之后的查询做准备，以“10号线地铁故障”为例，可能的分词如下（同义词问题暂时略过）：

10 0x123abc

号 0x13445d

线 0x234d

地铁 0x145cf

故障 0x354df

（2）查出含每个term的文档集合，即找出待选集合，如下：

0x123abc 1 2 3 4 7 9…..

0x13445d 2 5 8 9 10 11……

……

（3）求交，上述求交，文档2和文档9可能是我们需要找的，整个求交过程实际上关系着整个系统的性能，这里面包含了使用缓存等等手段进行性能优化；

（4）各种过滤，举例可能包含过滤掉死链、重复数据、色情、垃圾结果以及你懂的；

（5）最终排序，将最能满足用户需求的结果排序在最前，可能包括的有用信息如：网站的整体评价、网页质量、内容质量、资源质量、匹配程度、分散度、时效性等等，之后会详细给大家介绍。

如果大家对搜索引擎检索还有别的疑问，大家可以到[学堂同学汇][学习讨论]《搜索引擎检索系统概述》讨论帖中发表自己的看法，我们的工作人员会关注这里并与大家进行探讨。

来源：百度搜索资源平台百度搜索学堂

Public @ 2011-11-07 16:21:49

搜索引擎工作原理

搜索引擎的工作原理基本上包括以下几个步骤： 1. 网络爬虫：搜索引擎首先会派出网络爬虫（也称为蜘蛛或机器人），自动访问互联网上的页面，并把这些页面的内容和相关信息收集下来。 2. 索引：搜索引擎将爬取到的页面内容和相关信息存储到搜索引擎数据库中，以方便后续搜索。 3. 检索：当用户输入关键词进行搜索时，搜索引擎会根据关键词从数据库中检索相关的页面。 4. 排名：搜索引擎会根据一系列算法评估

Public @ 2023-04-19 05:00:10

爬行和抓取

爬行和抓取在计算机领域中都指数据采集的过程。爬行是指使用网络爬虫程序，通过抓取网页上的数据来建立一个数据集。例如，搜索引擎就使用网络爬虫程序来收集网页上的内容，以便用户进行搜索。抓取则是指通过编写程序从特定的网站或数据源上抓取数据，以便进行分析或者处理。例如，电商平台可以使用抓取程序从竞争对手的网站上抓取商品价格信息，以便制定自己的价格策略。总的来说，爬行和抓取都是数据采集的方式，只是

Public @ 2023-04-07 23:50:49