教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 求职职场 >

搜索引擎技术基础

来源:网络收集 时间:2026-09-07
导读: 搜索引擎原理 目录一、搜索引擎总体介绍 二、爬虫技术介绍 三、中文分词和排序算法介绍 四、查询/存储技术、Cache Server介绍 查询 存储技术、 介绍 存储技术 一、搜索引擎总体介绍 (一)搜索引擎定义 一 搜索引擎定义“搜索引擎”技术,完全来源于历史悠久的

搜索引擎原理

目录一、搜索引擎总体介绍 二、爬虫技术介绍 三、中文分词和排序算法介绍 四、查询/存储技术、Cache Server介绍 查询 存储技术、 介绍 存储技术

一、搜索引擎总体介绍 (一)搜索引擎定义 一 搜索引擎定义“搜索引擎”技术,完全来源于历史悠久的全文检索技术。 搜索引擎”技术,完全来源于历史悠久的全文检索技术。 “搜索引擎”从字面上可拆分为“搜”、“索”、“引擎” 搜索引擎”从字面上可拆分为“ 引擎” 三个含义。 三个含义。 就是大量信息的抓取, “搜”就是大量信息的抓取,抓取回来后的信息进行智能 提取、排重、质量分析等处理。 提取、排重、质量分析等处理。 就是大量处理后信息的存储、信息排序、 “索”就是大量处理后信息的存储、信息排序、快速查询 等。 引擎”就是指系统不但能存储亿级的数据, “引擎”就是指系统不但能存储亿级的数据,而且还能有 巨大的并发处理能力,这样的系统才有资格被叫着“ 巨大的并发处理能力,这样的系统才有资格被叫着“引 擎”。

一、搜索引擎总体介绍

(二)搜索引擎主要核心技术: 二 搜索引擎主要核心技术 搜索引擎主要核心技术:搜索引擎主要核心技术为: 搜索引擎主要核心技术为 (1)中英文分词语言处理; 中英文分词语言处理; 中英文分词语言处理 (2)排序算法; 排序算法; 排序算法 (3)网络爬虫; 网络爬虫; 网络爬虫 (4)查询 存储技术 查询/存储技术 查询

(三)搜索引擎的组成部分搜索引擎一般包括四个组成部分: 搜索引擎一般包括四个组成部分: 搜索器、索引器、检索器、 搜索器、索引器、检索器、用户接口 搜索器(爬虫 搜索器(爬虫SPIDER)的功能是在 中漫游, )的功能是在Internet中漫游,发现和搜集信息。 中漫游 发现和搜集信息。 索引器(INDEXER)的功能是理解搜索器所搜索的信息,从中抽取出索 的功能是理解搜索器所搜索的信息, 索引器 的功能是理解搜索器所搜索的信息 引项,用于描述文档以及生成文档集的索引表。 引项,用于描述文档以及生成文档集的索引表。 检索器 检索器(SEARCHER)的功能是根据用户的查询在索引库中快速检出文 的功能是根据用户的查询在索引库中快速检出文 进行文档与查询的相关度评价,对将要输出的结果进行排序, 档,进行文档与查询的相关度评价,对将要输出的结果进行排序,并 实现某种用户相关性反馈机制。 实现某种用户相关性反馈机制。 用户接口 用户接口(USER INTERFACE)的作用是输入用户查询、 显示查询结 的作用是输入用户查询、 的作用是输入用户查询 提供用户相关

性反馈机制。主要的目的是方便用户使用搜索引擎, 果、提供用户相关性反馈机制。主要的目的是方便用户使用搜索引擎, 高效率、多方式地从搜索引擎中得到有效、及时的信息。 高效率、多方式地从搜索引擎中得到有效、及时的信息。

一、搜索引擎总体介绍

(四)系统图: 四 系统图 系统图:

二、爬虫技术介绍

(一)爬虫技术总体介绍: 一 爬虫技术总体介绍 爬虫技术总体介绍:网络爬虫是一个自动提取网页的程序, 网络爬虫是一个自动提取网页的程序,它为搜索引擎 网上下载网页, 从Internet网上下载网页,是搜索引擎的重要组成。 网上下载网页 是搜索引擎的重要组成。 网络爬虫使用多线程技术, 网络爬虫使用多线程技术,让爬虫具备更强大的抓取 使用多线程技术 能力。 能力。 网络爬虫还要完成信息提取任务 还要完成信息提取任务, 网络爬虫还要完成信息提取任务,对于抓取回来的网 页提取出来:新闻 电子图书、行业信息等。 新闻、 页提取出来 新闻、电子图书、行业信息等。对于 MP3、图片、Flash等各种不同内容,要实现自动识 等各种不同内容, 、图片、 等各种不同内容 自动分类及相关属性测试(例如: 别、自动分类及相关属性测试(例如:MP3文件要包 文件要包 含的文件大小,下载速度等属性)。 含的文件大小,下载速度等属性)。

二、爬虫技术介绍

(二) 抓取对象: 二 抓取对象:1. 静态网页:爬虫从一个或若干初始网页的 静态网页:爬虫从一个或若干初始网页的URL开始,获得初始网 开始, 开始 页上的URL,在抓取网页的过程中,不断从当前页面上抽取新的 页上的 ,在抓取网页的过程中, URL放入队列 直到满足系统的一定停止条件。 放入队列,直到满足系统的一定停止条件 放入队列 直到满足系统的一定停止条件。 2.动态网页 分析动态网页参数,按照一定规章,“拼”出所有要被 动态网页:分析动态网页参数 按照一定规章, 动态网页 分析动态网页参数, 抓取内容URL,只抓取这些特定范围内动态网页。 抓取内容 ,只抓取这些特定范围内动态网页。 3.特殊内容:比如RSS、XML数据,情况特殊需特殊处理。如新闻 特殊内容:比如 数据, 特殊内容 、 数据 情况特殊需特殊处理。 的滚动新闻页面,需要爬虫不停地监控扫描, 的滚动新闻页面,需要爬虫不停地监控扫描,发现新内容马上就进 行抓取。 行抓取。 4. 文件对象:图片,MP3、Flash、视频等文件的抓取,都要特殊 文件对象:图片, 、 、视频等文件的抓取, 处理。比如说:图片抓取出来后,要知道图片文件类型、 处理。比如说:图片抓取出来后,要知道

图片文件类型、图片文件 的大小、图片的像素大小,还要转换出来缩略图。 的大小、图片的像素大小,还要转换出来缩略图。

二、爬虫技术介绍

(三) 抓取策略: 三 抓取策略:1. 深度优先策略:对于一些大网站及静态网页为主的抓取内容, 深度优先策略:对于一些大网站及静态网页为主的抓取内容, 采取深度策略抓取,便于在最短时间内获得最大量内容。 采取深度策略抓取,便于在最短时间内获得最大量内容。 2.广度优先策略 对于一些动态网页或小网站,采取广度策略抓 广度优先策略:对于一些动态网页或小网站 广度优先策略 对于一些动态网页或小网站, 同时对多个网站进行抓取,减小对各个小网站的压力, 取,同时对多个网站进行抓取,减小对各个小网站的压力,避 免造成恶意攻击。 免造成恶意攻击。 3.合作抓取策略 由被抓取网站,提供可被抓取内容的 合作抓取策略:由被抓取网站 提供可被抓取内容的sitemap 合作抓取策略 由被抓取网站, 网站地图,双方协议好,只抓取这些特定内容, 网站地图,双方协议好,只抓取这些特定内容,在抓取速度及 时间上双方前期进行协商。另外还可以完全由被抓取方, 时间上双方前期进行协商。另外还可以完全由被抓取方,提供 详细内容,抓取过程都可以省略一些步骤。 详细内容,抓取过程都可以省略一些步骤。

三、中文分词和排序算法介绍

(一)中文分词: 一 中文分词 中文分词:中文本身存在着很大的歧义性,同样一句话,不同的断句, 中文本身存在着很大的歧义性,同样一句话,不同的断句,表达 的意思就不一样。这对于计算机去做机器分析, 的意思就不一样。这对于计算机去做机器分析,就带来了巨大的 困难。 困难。 下面的中文断句,来自百度广告宣传片 下面的中文断句,来自百度广告宣传片:我知道你不知道我知道你不知道我知道你不知道」 「我知道你不知道我知道你不知道我知道你不知道」

三、中文分词和排序算法介绍

(一)中文分词: 一 中文分词 中文分词:另外中文的具体含义,还必须放在具体的前后语言环境中去分析。 另外中文的具体含义,还必须放在具体的前后语言环境中去分析。 比如说: 比如说:「乒乓球拍卖完了」 乒乓球拍卖完了」 我去学校商店,发现「 我去学校商店,发现 …… 此处隐藏:5366字,全部文档内容请下载后查看。喜欢就下载吧 ……

搜索引擎技术基础.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/1701100.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)