网页结构化信息抽取技术方法研究_郝爱峰
山西电子技术
研究探讨
2008年第4期
网页结构化信息抽取技术方法研究
郝爱峰
(忻州师范学院,山西忻州034100)
摘 要:分析了两种当前主流的网页结构化信息抽取技术方法:基于模版的分装器方法和不依赖模版的基于视觉的网页信息抽取技术方法,并在此基础上实现了一种新的网页结构化信息抽取算法,一定程度上提高了抽取效率和精度。
关键词:垂直搜索引擎;信息抽取;分装器;模版中图分类号:TP391 文献标识码:A
0 引言
搜索引擎自1994年面世后,有效工具。目前,,,,对。垂直搜索引擎是有相当的发展前景的,而web结构化信息抽取的技术水平是决定垂直搜索引擎质量的重要技术指标,因此结构化的信息抽取技术成为了垂直搜索引擎的关键技术之一。
信息抽取(InformationExtraction:IE)是把文本里包含的信息进行结构化处理,变成表格一样的组织形式。输入信息抽取系统的是原始文本,输出的是固定格式的信息点。信息抽取技术对于从大量的文档中抽取需要的特定事实来说是非常有用的,互联网上就存在着这么一个文档库。结构化信息抽取就是将网页的非结构化数据抽取成特定的结构化信息数据。它是垂直搜索引擎和通用搜索引擎最大的差别。网页结构化信息抽取技术方法的水平直接影响着垂直搜索引擎的搜索效果。本文将结合模板方式和基于视觉分析的结构化信息抽取方式,提出一种新的网页结构化信息抽取技术。
IEWeb视觉分析的信息抽取的主要依据是在同一个,且待提取信息在视觉样式与其它信息有着明显的分隔符;根据这一原则该方法首先就是要找出这些可视化的线索,然后再根据这些线索来进行信息抽取。为此,可将Html元素分成以下几类:1)简单对象:不能包含其它html元素的元素,如<mig>、<hr>等;2)容器对象:由至少一个简单对象和其它容器对象组成的html元素,如<table>;3)分组对象:全部由简单对象组成的元素。该方法首先分析简单对象的视觉特征,然后在从里层到外层依次分析分组对象或容器对象,它的难点在于分析过程中既有精确的分析又有模糊分析;网页分析完成后再对结果进行频率分析,以推导出哪些对象是要抽取的信息。
2 系统的设计和实现
由于本系统只是为了实现并测试所设计的信息抽取算法,故而忽略了和垂直搜索引擎的其他部分之间接口的处理方法。并且对网络蜘蛛爬行回的网页格式有较为严格的要求。本系统主要分为模版的建立和主程序的信息抽取两部分。在下面的文字中将对其分别进行说明。2.1 建立网页模版库模版是分装器的核心,分装器方法就是依托于模版而形成的。本系统采用人工方式来制作模版。本系统中使用的模版是一种使用html
语言描述网页大致框架的结构性文本。
1 相关技术
网页结构化信息抽取有多种技术,例如:基于分装器(Wrapper)的信息抽取、基于隐马尔可夫模型(HMM)的信息抽取、DIPRE抽取、基于Web视觉分析的信息抽取。在本系统中采用了分装器技术和基于视觉分析的网页信息抽取技术,并将两种系统有机结合起来。1.1 分装器技术分装器是一个程序,用于从特定的信息源中抽取相关内容,并以特定形式加以表示。在数据库环境下,分装器是软件的组成部分,负责把数据和查询请求从一种模式转换成另外一种模式。在因特网环境下,分装器的目的是把网页中储存的信息用结构化的形式储存起来,以方便进一步的处理。
分装器生成(WG)领域独立于传统的IE领域。典型的WG应用系统能从网上数据库返回的查询结果网页中抽取数据。这些网页构成一个被WG业内人称之为“半结构化”的信息源。为了能把这些网页的数据整合在一起,必须把相关的信息从这些网页中抽取出来。因此,分装器实质上是针收稿日期:2008-07-08 作者 郝爱峰 男 29岁 助教
图1 建立网页模版流程图
76 山 西 电 子 技 术 2008年
4)令当前模版数i加一。
5)从模版库中提取出第i个模版。
6)令网页与模版比较,判断网页是否与此模版匹配。如匹配转7),不匹配转4)。
7)判断模版库中第i个模版是否为有链接的模版。是转9),否转11)。
8)从标记中提取当前网页的模版数i。
9)使用该模版抽取待抽取信息的网页中的链接。
10)将抽取出的链接传至网络蜘蛛,并将该模版数i标记。11)使用当前模板代表的规则对网页进行信息抽取。2.3 网页结构化信息抽取算法
因为本系统中的模版采用人工手动方式进行编写,所以
事先应从相应的网站上下载一些网页,并以此为基础创建该网页的模版
。
图2 分装器算法流程图
建立模版的步骤如下:
1)从网站上下载一些同源的网页,并将其保存为html格式。
2)打开其中一个网页,将其中有关于网页内容的字段逐一删除。并在要提取的信息部位作标记,将其保存作为初始模版。
3)打开另一个网页将其与初始模版进行对比,修改初始模版。
4)反复进行步骤4),或继续。
5)将模版带入程序看是否正确。是则将初始模版纳入模版库,否则返回步骤4)。
模版应是一种标准html文本,并且应和对应网站的网页结构完全一致,但在实际使用中因网站数目是有限的。所以模版的长度可以适当缩减。只要能保证网页能顺利识别,网页信息能够准确的抽取就可以了。2.2 分装器算法详解由于系统采用的算法是分装器和视觉分析相结合,并以分装器为主,视觉分析为辅的方式。所以分装器是系统中最重要的组成部分。又由于一些网页本身包含信息不全,需要打开链接抽取其它网页中的信息(暗藏网),在抽取这些网页中的信息同时还应抽取其中包含的链接,并在网络蜘蛛传回网页时优先处理。这样使分装器部分较其它部分更为复杂,故将其单独列出加以描述。
对于网络蜘蛛爬行回的网页,分装器对其应优先抽取,以保证当前网页信息与上一网页信息的完整性,吻合性。
其详细步骤如下:
1)系统将待提取信息的网页传至分装器。
2)判断此网页是否由网络蜘蛛直接传入。是转8),否转3)。
3)设置当前模版数i=0。
出来,。,视觉分析技术为分装,两种技术相辅相成,有机组合成本系统。
具体抽取步骤如下:
1)从本地计算机中读入一个html格式的待抽取信息的网页。
2)将网页传入分装器,分装器依赖于模版库中的模版对网页进行信息抽取。
3)判断分装器抽取信息是否成功。成功,转向第5)步,失败,转向第4)步。
4)使用基于视觉分析的网页信息抽取技术对网页信息进行抽取。
5)将抽取出的信息添加到数据库当中。
6)显示数据库中已抽取出的网页结构化信息。(可选)抽取算法流程图如图3。
由于本系统是垂直搜索引擎的一个中间部分,具有承前启后的作用。系统中待抽取信息的网页是由网络蜘蛛从网络中抓取而来的html文件。而数据库中的结构化信息将用来进一步对比,去重,排列后待用户查询
。
图3 抽取算法流程图
3 算法的优点和不足
3.1 所用算法的优点
(下转第81页)
第4期 张青云:国产数据库在政府电子政务领域中的应用
4)可扩展性方面的64位运算能力、SMP支持能力确保多CPU条件下的高效率。
5)可移植性方面提供了各种数据库标准通用接口,具有异构数据库访问能力,确保企业现有数据资产的保值增值。
高性能、高服务、高品牌都是以数据库核心技术为基础的,国产数据库在数据库应 …… 此处隐藏:4438字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [实用文档]李践-有效提升销售的12大黄金法则8-大
- [实用文档]党支部换届工作方案
- [实用文档]2013年下期电子商务专业部宣传工作计划
- [实用文档]方庄一矿通风、钻探绩效工资考核管理办
- [实用文档]项目一 认识企业物流认识企业物流
- [实用文档]MBI_Display_产品蓝图规画
- [实用文档]北京市建筑业劳务作业人员普法维权培训
- [实用文档]锅炉燃烧调整与运行优化
- [实用文档]4支付结算业务的核算
- [实用文档]米什金_货币金融学_第9版各章学习指导
- [实用文档]水泥混凝土路面硬化工程施工组织设计
- [实用文档]钢筋工程安全技术交底书
- [实用文档]关于公布华中师范大学本科毕业论文
- [实用文档]太原市园林绿化施工合同范本 2
- [实用文档]周日辅导 初中英语分类复习单项选择题(
- [实用文档]第四章 文化经纪人的管理形式 第二节
- [实用文档]学宪法讲宪法竞赛题库
- [实用文档]《数值计算方法》期末考试模拟试题二
- [实用文档]爱词霸学英语:每日一句( 十月)
- [实用文档]2014年国家公务员面试:无领导小组讨论
- 新课程主要理念和教学案例分析汇编(24
- 英国人的快乐源于幸福的家庭生活
- 七年级上册第一次月考模拟数学试卷
- 真丝及仿真丝的种类有哪些?
- 【最新】华师大版八年级数学下册第十六
- 高中英语3500个必背单词
- 我可以接受失败,但我不能接受放弃!
- 最近更新沪科版八年级物理上册期末试卷
- 绿化工作先进乡镇事迹材料
- 鲁教版九年级上册思想品德教学计划
- 英语音标的分类
- 地下室底板无梁楼盖与普通梁板结构形式
- 美容师黄金销售话术
- 雅思写作满分作文备考方法
- 血清甲状腺激素测定与高频彩色多普勒超
- 1度浅析装修对室内空气品质的影响
- 2017-2022年中国汞矿行业深度分析与投
- 计算机二级VB公共基础知识
- (何勇)秸秆禁烧_重在寻找出路
- 内外墙抹灰工程分包施工合同1




