搜索引擎技术的研究与站内搜索的实现
搜索引擎技术的研究与站内搜索的实现
86能源技术与管理2006年第2期
搜索引擎技术的研究与站内搜索的实现
鲍
[摘
要]
劼
(中国矿业大学图书馆技术部,江苏徐州221008)
介绍搜索引擎的相关知识及其工作原理,而后通过自己设计制作的一具体实例来详细分析了站内搜索的实现。
[关键词]搜索引擎;站内搜索;信息
[中图分类号]G250.71[文献标识码]A[文章编号]1672!9943(2006)02!0086!02
0引言
程序接入到其索引程序中,创建了大家现在熟知的Lycos。同年4月,斯坦福大学的两名博士生,
随着信息社会的到来,因特网作为信息交流的中心与枢纽作用也愈显重要。因特网可以称之为一个巨大的信息库,它拥有众多但却杂乱无章的信息,并且这些信息每时每刻都在以几何级数递增。如何从因特网上获取自己所需信息就成了一个大问题。搜索引擎正是在这种情况下应运而生,它成为我们打开因特网这座信息宝库的一把万能钥匙。现代化的高校图书馆正向数字化方向发展,海量的信息汇聚于此,因而数字化图书馆站内搜索的实现也就益趋重要。
DavidFilo和美籍华人杨致远共同创办了超级目录索引Yahoo,并成功地使搜索引擎的概念深入
人心。从此搜索引擎进入了高速发展时期。1998年9月,两位斯坦福大学在读博士生LarryPage和SergeyBrin在风险投资公司KleinerPerkins
Caufield&Byers及SequoiaCapital的资助下,成功开发了新一代搜索引擎—Google。目前,互联网
上的搜索引擎已达数百家,其检索的信息量也与从前不可同日而语。
1.2搜索引擎的分类及其工作原理[1 ̄3]
搜索引擎按其工作原理主要可分为三种,分
1
1.1
搜索引擎
搜索引擎的历史
现代意义上的搜索引擎的祖先,是1990年由
别是全文搜索引擎(FullTextSearchEngine)、目录索引类搜索引擎(SearchIndex/Directory)和元搜索引擎(MetaSearchEngine)。
全文搜索引擎:通过从互联网上提取的各个网站的信息(以网页文字为主)而建立的数据库中,检索与用户查询条件匹配的相关记录,然后按一定的排列顺序将结果返回给用户,因此他们是真正的搜索引擎。从搜索结果来源的角度,全文搜索引擎又可细分为两种,一种是拥有自己的检索程序(Indexer),俗称“蜘蛛”(Spider)程序或“机器人”(Robot)程序,并自建网页数据库,搜索结果直接从自身的数据库中调用,如国外的Google、Fast/等,国内的百度;另一种则AllTheWeb、AltaVista、是租用其他引擎的数据库,并按自定的格式排列搜索结果,如Lycos引擎。
目录索引类搜索引擎:目录索引虽然有搜索功能,但在严格意义上算不上是真正的搜索引擎,仅仅是通过“人工”的方式精心挑选高质量的网站,并按类别排列,用户完全可以不用进行关键词(Keywords)查询,仅靠分类目录也可找到需要的
蒙特利尔大学学生AlanEmtage发明的Archie。虽然当时WorldWideWeb还未出现,但网络中文件传输还是相当频繁的,而且由于大量的文件散布在各个分散的FTP主机中,查询起来非常不便,因此AlanEmtage想到了开发一个可以以文件名查找文件的系统,于是便有了Archie,其工作原理与现在的搜索引擎已经很接近,它依靠脚本程序自动搜索网上的文件,然后对有关信息进行索引,供使用者以一定的表达式查询。
当时,“机器人”一词在编程者中十分流行。电脑“机器人”(ComputerRobot)是指某个能以人类无法达到的速度不间断地执行某项任务的软件程序。由于专门用于检索信息的“机器人”程序象蜘蛛一样在网络间爬来爬去,因此,搜索引擎的“机器人”程序就被称为“蜘蛛”程序。
最早真正意义上的搜索引擎出现于1994年当时MichaelMauldin将JohnLeavitt的蜘蛛7月。
搜索引擎技术的研究与站内搜索的实现
2006年第2期鲍劼搜索引擎技术的研究与站内搜索的实现87
信息。目录索引中最具代表性的莫过于大名鼎鼎的Yahoo雅虎。国内的搜狐、新浪、网易搜索也都属于这一类。
元搜索引擎在接受用户查询请求时,同时在其他多个引擎上进行搜索,并将结果返回给用户。著名的元搜索引擎有InfoSpace、Dogpile、Vivisimo等,中文元搜索引擎中具代表性的有搜星搜索引擎。
Endif
FrmSearch.Submit
2.2
EndSub
SubDisplay_from()
完成显示窗口字段。
SubDisplay_form()
Response.Write"<h>站内搜索</h>"
Response.Write"<formmethod='post'name=frmSearch>"&vbCrLf
Response.Write"查询字符串:"&vbCrLfResponse.Write"<inputtype=textsize=16name=txtsearchvalue=''>"
Response.WriteRequest.Form("txtSearch")&'""
Response.Write"  "&vbCrLfResponse.Write"<inputtype=buttonvalue='查询'>"
Response.Write"<onlclick='datacheck'>"
&vbCrLf
Response.Write"</form>"EndSub
2.3SubOut_result()
这一模块是搜索实现的重点,下面详细分析该子程序站内搜索。
(1)建立FileSystemObject的执行个体。
1.3搜索引擎检索信息模型
依据搜索引擎检索信息的方式不同,可以将
信息检索模型分为:布尔逻辑模型、模糊逻辑模型、向量空间模型及概率模型等。布尔逻辑模型是最简单的检索模型,标准的布尔逻辑模型是二元逻辑,所检索的文档要么与所键入的关键词相关,要么无关,检索结果一般不进行相关性排序。模糊逻辑模型,是为了克服布尔逻辑模型检索结果无序性而采用的,在检索结果处理中使用了模糊逻辑运算,将所检索的数据库文档信息与所键入的关键词进行模糊逻辑比较,按照相关的优先次序排列检索结果。向量空间模型是用检索项的向量空间来表示用户的检索要求和数据库文档信息,依向量空间的相似性来排列检索结果,向量空间模型不仅可以方便地产生有效的检索结果,而且能提供相关文档的文摘,并进行检索结果分类,为用户提供准确的所需信息。概率模型是利用相关反馈的归纳学习方法,获取匹配函数。其实,许多检索系统往往将上述各种模型混合在一起,以达到最佳的检索效果。由于各搜索引擎使用了不同的模型、方法去侦测、查找网站,所以检索结果会有天壤之别。
SetobjFS=Sever.CreateObject("Sc …… 此处隐藏:3720字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [求职职场]加法运算定律的运用练习题
- [求职职场]大型石油化工工业过程节能新技术
- [求职职场]2015-2020年中国箱纸板行业分析与投资
- [求职职场]NADEX-IWC5A点焊机故障代码
- [求职职场]英语阅读 非常有用
- [求职职场]鲁卫疾控发〔2012〕2号(联合,印发山东
- [求职职场]2014年莆田公务员行测技巧:数字推理的
- [求职职场]基于最近发展区理论的高中数学课堂有效
- [求职职场]与贸易有关的知识产权协议
- [求职职场]【王风范】微演说·职场演说三
- [求职职场]新时代国珍健康大课堂
- [求职职场]群论期末考试复习题
- [求职职场]施工现场消防安全专项施工方案(范本)-
- [求职职场]初中物理光学知识点归纳完美版
- [求职职场]毕业设计总结与体会范文
- [求职职场]江南大学2018年上半年展示设计第1阶段
- [求职职场]景尚乡民兵参战支前保障方案
- [求职职场]【优质】2019年工会职工之家建设工作总
- [求职职场]数据库技术与应用—SQL Server 2008(第
- [求职职场]汽车变速箱构造与工作原理
- 首钢工业区工业遗产资源保护与再利用研
- 第4课 《大学》节选
- 2016程序文件——检验检测结果发布程序
- 2011年高考试题文言文阅读全解释__2011
- 化学是一门基础的自然科学
- 海外做市商制度的借鉴意义
- 外国建筑史复习资料(
- 七年级下思想品德期末综合测试(二)
- 思政课部2013年上学期教学工作总结
- 电大国际公法任务3 0004
- 《圆的认识》教学设计
- 中国轨道交通牵引变流器行业市场发展调
- 中泰证券#定期报告:坚守时代硬科技和
- 浅论企业财务管理与企业经营投资风险的
- 大功率半导体激光器光纤耦合技术调研报
- 中国传统家具的现状与发展探讨
- Broadcom数字电视芯片助海尔扩展高清电
- 新HSK4词汇练习 超全(五)
- 2013届高考数学单元考点复习12
- 雨霖铃精品课件




