智能检索中的网络数据挖掘技术探索
智能检索中的网络数据挖掘技术探索
中国图书馆学报(双月刊)2002年第3期
Z]}删GGI,O
TUSHUGUANXUEBAO
●晏创业张玉峰
智能检索中的网络数据挖掘技术探索“
摘妻缺少一种深^信息内容的网络信息搜索工肄。是实现智能硷索的主要围难。采用阿络数据挖掘技术是解奂问题的关键。从智能信息检索的角度出发,丰耍考虑从网络信息内容的戈联度来挖掘网络数据。图1.表1。参考义献7。关键词智能检索
分类号G2527
刚络信息检索数据挖捌
AI&C;TRACT
Theauthorsthlnkthatthemajordifile山v
in
realuing
intdligcaatsearchisthelackd
to
a
networkinformationsearchtoalreachinginformationcontesats,andthekeynetworkdataminingtechniquestheminingof
solvetheproblemisthe
COHIeHts
They如discuss
flg
ltab
7refs
therelevanccofnetworkinformationfor
network
datal
KEYWORDS
Intelligentsearch
G2527
Networkinformationsearch
Data
mining
CI』ASSNUMliER
智能检索能帮助人{『J在开发网络信息资源时馓到“取其精华.去其糟粕”。它能摆脱表层信息的下扰,从信息内容的角度出发,搜索出高质量的信息。目前,人们对信息检
索过程中的智能化要求主要体现在基于内容的检索、个性化信息检索和知识检索。
目特同上的信息资源不同于一般意义上的数据库.除
数据挖掘(DataMining)是从大量的、不完全的、有噪声的、随机的数据中,提取潜在有用的信息和知识的过程。数据挖掘源自人工智能的机器学习领域,是在一个已知状态的数据集上。通过设定一定的学习算法.从数据集中获取所需的知识。这些知识能够用J‘倍皂管理、智能查询、决策支持、过程控制叭及其他方面,
具有开放性、异构性和分布性等特点外.还具有半结构化、非结构化的动态关联特性。网络信息的特点央定了我们不能像对待静态结构化的数据库信息那样来对待它。然而,当前的一些网络信息搜索工具仍遵循了大型数据库的信息
检索思想.旦口对网贞的标题、URL等表征信息和没有进行深
数据挖掘的最初对象是一些大型的商业数据库.岜通过描述数据、计算统计变量(比如平均值、均方差等),并将
这些变量用图表直观地表示出来,进而找出数据变量之间
的相关性,即发现知识,以提供解决问题的依据。随着数据
挖掘技术在商业数据库中的成功直用,它卫被迅速移植到
度分析的关键词进行标引,然后建立网络信息的倒排文档,
将它们简单地聚合在一起。这种以数据库信息处理方式组
电信、医疗保险等领域,因特网的出现为它提供丁一个更为
广阔的用武空间。借用数据挖掘的原理来实现网络数据的
织起来的信息源,在检索中主要有3个弊端:一是同一关键词检索出来的信息“貌台种离“;二是检索结果中出现大量的冗余信息;三是因为信息用户理解差异的存在,在使用某些检索词时根本就检索不到任何信息。
基于内容的检索和个性化的信息检索.都是建立在网络信息内容基础之上的.真正的知识性,是儿对信息内容的
深层挖掘中体现出来的。面对因特网上源源生成的信息.
探层挖掘.发现并组织网络知识,是将网络信息检索技术推
向智能化高度的有救手段。
1
2网络数据挖l模型设计
网络数据有小同于一般数据库中数据的特点:异构和
半结构化。因特网上的每一个站点都是一个数据源.每一
个数据根都有自己的设计风格,即每个站点的信息和组织
都不一样,用特网就是一个巨大的异构数据库.不删于传统的关系数据库。因特同上的数据非常复杂,没有统
的模
我1『】需要 种太批量、深人内容的信息处理技术,使其按照内容特性聚集.并体现一定的知识性。将最初面向数据库的数据挖掘技术引入到崮特网中,是解决问题的关键。
型描述,这些数据虽有定的结构性,但网自述层次的存在
和复杂的相互关联,因而是一种非完全结构化的数据。鉴
于网络数据的这些特点,我们在将数据挖掘技术引^因特
1面目目特目的数据挖掘
1
网的时候,必须要做定的预处理工作,在此基础上的网
1数据挖撮的棚关韧识
络数据挖掘模型如图1所示。
*
本文系国家杜科基金资助项目(编号:0IBTQ011)的研究论文。
万方数据
49
智能检索中的网络数据挖掘技术探索
第28卷第139期
Vd28
N0139
中国|圭|书馆学报
THE.JOURNALOFTHELIBRARYSCIENCEINCHINA
2002年5月
Mav.2002
匪1网络数据挖掘模型
图1实际上是一个对传统搜索引擎改进的模型,将数据
挖掘技术加载到搜索引擎上.从而实现网络数据的挖掘。
XML信息预处理模块是实现网络数据挖掘的关键环
节,但若遵循常规将Spider或Robot采集的异构网络数据,
按照一种统一的数据结构置新组合,将会因工作量太大m
难以实现。XML(ExtensibleMarkupLanguage)的出现为解央网络数据挖掘难题带来了希望。XML是一种简单、开放、
高效H可扩充、符合国际标准的网络标记浯言,它的扩展性
和灵活性使其能描述不同种类应用软件中的数据,从而描
述搜集的网页中的数据记录。用XML标引的网培数据是
一种半结构化的数据模型,但其文档描述可与关系数据库
中的属性一一对应起来,从而能实施精确的矗询与模型抽
取.完成异构网络数据的整合工作。
2目络数据挖掘豹算法及其对智能捡l的支持
数据挖掘技术已在许多领域得到成功应用.针对不同领域的数据类型.人们采用了不同的挖掘算法,目前比较成
中都能派上用场。从智能信息检索的角度出发.主要考虑的是从网络信息内容的关联度来挖掘网络数据,所以这里主要分析关联规则和分类两种挖掘算法。在个性化信息检索中,用户对信息酌需求是强调兴趣当的规则,可提高数据挖掘的准度和深度。关联规则算法的一般流程是:
(1)选取台适的元素。要根据不间的统计级别,选择相
(2)确立挖掘规则。所渭的规则就是一个条件和一个
condi“onthen
result。它是组织相关内容的
一50一
万 方数据班信息(F),表1给出用户关心这两类信息的百分比。
襄1挖掘规则举例
信息元组
信息点击苹(%)
C
40
支持度是指一个元组被点击的频率,比如c的支持度s
(c)=45%;町信度屉相对 …… 此处隐藏:2307字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [小学教育]四年级综合实践活动课《衣物的洗涤》教
- [小学教育]2014半年工作总结怎么写
- [小学教育]20世纪外国文学专题综合试题及答案
- [小学教育]TS_1循环使用催化丙烯环氧化反应研究
- [小学教育]最实用的考勤签到表(上下班签到表)
- [小学教育]气候与生态建筑——以新疆民居为例
- [小学教育]二人以上股东有限责任公司章程参考样本
- [小学教育]2014届第一轮复习资料4.1,3美好生活的
- [小学教育]土方开挖、降水方案
- [小学教育]手绘儿童绘本《秋天的图画》(蜡笔)
- [小学教育]2002级硕士研究生卫生统计学考试试题
- [小学教育]环保装备重点发展目录
- [小学教育]金蝶K3合并报表培训教材
- [小学教育]岩浆岩试题及参考答案
- [小学教育]知之深爱之切学习心得
- [小学教育]第十二章 蛋白质的生物合成
- [小学教育]Chapter 2-3 Solid structure and basi
- [小学教育]市政道路雨季专项施工方案
- [小学教育]中国海洋大学2012-2013学年第二学期天
- [小学教育]教育心理学第3章-学习迁移
- 浅谈深化国企改革中加强党管企业
- 2006年中国病理生理学会学术活动安排
- 设计投标工作大纲
- 基于ARP的网络攻击与防御
- 2016届湖北省七市(州)教科研协作体高三
- Google_学术搜索及其检索技巧
- 2019-2020学年七年级地理下册6.3美洲教
- 城市道路可研报告
- 【名师指津】2012高考英语 写作基础技
- 6级知识点培训北京师范大学《幼儿智趣
- 注册会计师会计知识点:金融资产
- 新安装 500 kV 变压器介损分析与判断
- PS2模拟器PCSX2设置及使用教程.
- 医院药事管理与药剂科管理组织机构
- {PPT背景素材}丹巴的醉人美景,免费,一
- NAS网络存储应用解决方案
- 青海省西宁市六年级上学期数学期末考试
- 测量管理体系手册依据ISO10012:2003
- 洞子小学培养骨干教师工作计划
- 浅谈《牛津初中英语》的教材特点及教学




