教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 求职职场 >

搜索引擎技术的研究与站内搜索的实现

来源:网络收集 时间:2026-09-07
导读: 搜索引擎技术的研究与站内搜索的实现 86能源技术与管理2006年第2期 搜索引擎技术的研究与站内搜索的实现 鲍 [摘 要] 劼 (中国矿业大学图书馆技术部,江苏徐州221008) 介绍搜索引擎的相关知识及其工作原理,而后通过自己设计制作的一具体实

搜索引擎技术的研究与站内搜索的实现

86能源技术与管理2006年第2期

搜索引擎技术的研究与站内搜索的实现

[摘

要]

(中国矿业大学图书馆技术部,江苏徐州221008)

介绍搜索引擎的相关知识及其工作原理,而后通过自己设计制作的一具体实例来详细分析了站内搜索的实现。

[关键词]搜索引擎;站内搜索;信息

[中图分类号]G250.71[文献标识码]A[文章编号]1672!9943(2006)02!0086!02

0引言

程序接入到其索引程序中,创建了大家现在熟知的Lycos。同年4月,斯坦福大学的两名博士生,

随着信息社会的到来,因特网作为信息交流的中心与枢纽作用也愈显重要。因特网可以称之为一个巨大的信息库,它拥有众多但却杂乱无章的信息,并且这些信息每时每刻都在以几何级数递增。如何从因特网上获取自己所需信息就成了一个大问题。搜索引擎正是在这种情况下应运而生,它成为我们打开因特网这座信息宝库的一把万能钥匙。现代化的高校图书馆正向数字化方向发展,海量的信息汇聚于此,因而数字化图书馆站内搜索的实现也就益趋重要。

DavidFilo和美籍华人杨致远共同创办了超级目录索引Yahoo,并成功地使搜索引擎的概念深入

人心。从此搜索引擎进入了高速发展时期。1998年9月,两位斯坦福大学在读博士生LarryPage和SergeyBrin在风险投资公司KleinerPerkins

Caufield&Byers及SequoiaCapital的资助下,成功开发了新一代搜索引擎—Google。目前,互联网

上的搜索引擎已达数百家,其检索的信息量也与从前不可同日而语。

1.2搜索引擎的分类及其工作原理[1 ̄3]

搜索引擎按其工作原理主要可分为三种,分

1.1

搜索引擎

搜索引擎的历史

现代意义上的搜索引擎的祖先,是1990年由

别是全文搜索引擎(FullTextSearchEngine)、目录索引类搜索引擎(SearchIndex/Directory)和元搜索引擎(MetaSearchEngine)。

全文搜索引擎:通过从互联网上提取的各个网站的信息(以网页文字为主)而建立的数据库中,检索与用户查询条件匹配的相关记录,然后按一定的排列顺序将结果返回给用户,因此他们是真正的搜索引擎。从搜索结果来源的角度,全文搜索引擎又可细分为两种,一种是拥有自己的检索程序(Indexer),俗称“蜘蛛”(Spider)程序或“机器人”(Robot)程序,并自建网页数据库,搜索结果直接从自身的数据库中调用,如国外的Google、Fast/等,国内的百度;另一种则AllTheWeb、AltaVista、是租用其他引擎的数据库,并按自定的格式排列搜索结果,如Lycos引擎。

目录索引类搜索引擎:目录索引虽然有搜索功能,但在严格意义上算不上是真正的搜索引擎,仅仅是通过“人工”的方式精心挑选高质量的网站,并按类别排列,用户完全可以不用进行关键词(Keywords)查询,仅靠分类目录也可找到需要的

蒙特利尔大学学生AlanEmtage发明的Archie。虽然当时WorldWideWeb还未出现,但网络中文件传输还是相当频繁的,而且由于大量的文件散布在各个分散的FTP主机中,查询起来非常不便,因此AlanEmtage想到了开发一个可以以文件名查找文件的系统,于是便有了Archie,其工作原理与现在的搜索引擎已经很接近,它依靠脚本程序自动搜索网上的文件,然后对有关信息进行索引,供使用者以一定的表达式查询。

当时,“机器人”一词在编程者中十分流行。电脑“机器人”(ComputerRobot)是指某个能以人类无法达到的速度不间断地执行某项任务的软件程序。由于专门用于检索信息的“机器人”程序象蜘蛛一样在网络间爬来爬去,因此,搜索引擎的“机器人”程序就被称为“蜘蛛”程序。

最早真正意义上的搜索引擎出现于1994年当时MichaelMauldin将JohnLeavitt的蜘蛛7月。

搜索引擎技术的研究与站内搜索的实现

2006年第2期鲍劼搜索引擎技术的研究与站内搜索的实现87

信息。目录索引中最具代表性的莫过于大名鼎鼎的Yahoo雅虎。国内的搜狐、新浪、网易搜索也都属于这一类。

元搜索引擎在接受用户查询请求时,同时在其他多个引擎上进行搜索,并将结果返回给用户。著名的元搜索引擎有InfoSpace、Dogpile、Vivisimo等,中文元搜索引擎中具代表性的有搜星搜索引擎。

Endif

FrmSearch.Submit

2.2

EndSub

SubDisplay_from()

完成显示窗口字段。

SubDisplay_form()

Response.Write"<h>站内搜索</h>"

Response.Write"<formmethod='post'name=frmSearch>"&vbCrLf

Response.Write"查询字符串:"&vbCrLfResponse.Write"<inputtype=textsize=16name=txtsearchvalue=''>"

Response.WriteRequest.Form("txtSearch")&'""

Response.Write"  "&vbCrLfResponse.Write"<inputtype=buttonvalue='查询'>"

Response.Write"<onlclick='datacheck'>"

&vbCrLf

Response.Write"</form>"EndSub

2.3SubOut_result()

这一模块是搜索实现的重点,下面详细分析该子程序站内搜索。

(1)建立FileSystemObject的执行个体。

1.3搜索引擎检索信息模型

依据搜索引擎检索信息的方式不同,可以将

信息检索模型分为:布尔逻辑模型、模糊逻辑模型、向量空间模型及概率模型等。布尔逻辑模型是最简单的检索模型,标准的布尔逻辑模型是二元逻辑,所检索的文档要么与所键入的关键词相关,要么无关,检索结果一般不进行相关性排序。模糊逻辑模型,是为了克服布尔逻辑模型检索结果无序性而采用的,在检索结果处理中使用了模糊逻辑运算,将所检索的数据库文档信息与所键入的关键词进行模糊逻辑比较,按照相关的优先次序排列检索结果。向量空间模型是用检索项的向量空间来表示用户的检索要求和数据库文档信息,依向量空间的相似性来排列检索结果,向量空间模型不仅可以方便地产生有效的检索结果,而且能提供相关文档的文摘,并进行检索结果分类,为用户提供准确的所需信息。概率模型是利用相关反馈的归纳学习方法,获取匹配函数。其实,许多检索系统往往将上述各种模型混合在一起,以达到最佳的检索效果。由于各搜索引擎使用了不同的模型、方法去侦测、查找网站,所以检索结果会有天壤之别。

SetobjFS=Sever.CreateObject("Sc …… 此处隐藏:3720字,全部文档内容请下载后查看。喜欢就下载吧 ……

搜索引擎技术的研究与站内搜索的实现.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/1701070.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)