教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 范文大全 > 文秘资料 >

数据挖掘技术调研

来源:网络收集 时间:2026-07-22
导读: 1.定义: 数据挖掘(Data Mining,或称 DM)又称为数据库中的知识发现(Knowledge Discovery from Database,简称 KDD)数据挖掘是一个从不完整的、不明确的、大量的并且包含噪声,具有随机性的实际应用数据中,提取出隐含其中潜在有用的知识或模式的过程。

1.定义:

数据挖掘(Data Mining,或称 DM)又称为数据库中的知识发现(Knowledge Discovery from Database,简称 KDD)数据挖掘是一个从不完整的、不明确的、大量的并且包含噪声,具有随机性的实际应用数据中,提取出隐含其中潜在有用的知识或模式的过程。

2.基本概念:

文献:《数据挖掘算法及其应用研究》 《数据挖掘中聚类分析算法的研究与应用》

近十多年来,数据挖掘在全世界信息产业界受到了极大的关注,并飞速发展,究其原因,在于全球信息技术的迅速发展和互联网的快速普及造成了数据过量和信息爆炸,人们迫切需要有这样一种技术可以帮助他们从浩如烟海的信息中找出他们真正需要的、有价值的那一部分信息和知识。而数据挖掘正是解决以上问题的有效手段。关于数据挖掘,最简单明确的表述是从海量、混杂的数据里挖掘或者提取有用模式或知识的一个过程。数据挖掘可以说是一门跨多个学科和知识领域的新兴课题,它将人们应用数据的方式从原本简单的查询提升至在数据里挖掘与发现知识以对决策行为提供支持。而为了能满足人们从数据里发现知识的需求,来自不同领域,如数据库领域、模式识别领域、机器学习领域、人工智能领域、统计学领域、可视化领域和并行计算领域等的诸多优秀的研究者和技术专家都致力于研究这个新兴的课题——数据挖掘,不断研究和创造出优秀的研究成果,也使得数据挖掘成为了新的技术热点。通过数据挖掘可得到多种知识,而这些知识最终可以应用到多个方面,包括给相关组织和个人提供决策支持。在一般情况下用户并不了解大量的数据中蕴藏了哪些有意义有价值的信息,所以,对数

据挖掘系统来说,应该同时能够搜索发现多种形式的信息知识,进而满足用户的实际要求和期望。

。其主要有三个特点:

(1)海量数据。

(2)未知的有价值的规律。数据挖掘所发现的规律,应该是有用的并且不应该是显而易见的,应该是对不同的任务来说有意义的、隐藏的规律。

(3)数据挖掘是一个过程。他需要数据理解、业务理解、数据准备、评估、建模、部署等一系列步骤,数据挖掘人员的业务能力和分析能力对成功有重要的影响。

数据挖掘的主要有任务有两点:描述型和分类预测型的任务。描述型的任务是指通过数据库数据的自身内部联系,从而得到数据库中数据关系或者数据库的概要描述。分类预测型的任务是指通过现有的已经知道的分类的数据学习模型以及类的标签的区别,称作为预测型和分类型。

3.数据挖掘的由来:

上世纪九十年代, 随着数据库系统的广泛应用和网络技术的高速发展, 数据库技术也进入一个全新的阶段, 即从过去仅管理一些简单数据发展到管理由各种计算机所产生的图形、图像、音频、视频、电子档案、Web页面等多种类型的复杂数据, 并且数据量也越来越大。在给我们提供丰富信息的同时, 也体现出明显的海量信息特征。信息爆炸时代, 海量信息给人们带来许多负面影响, 最主要的就是有效信息难以提炼。过多无用的信息必然会产生信息距离( 信息状态转移距离, 是对一个事物信息状态转移所遇到障碍的测度, 简称DIST或DIT )和有用知识的

丢失。这也就是约翰·内斯伯特( John Naisbert) 称为的“ 信息丰富而知识贫乏”窘境。因此, 人们迫切希望能对海量数据进行深入分析, 发现并提取隐藏在其中的信息, 以更好地利用这些数据。但仅以数据库系统的录入、查询、统计等功能, 无法发现数据中存在的关系和规则, 无法根据现有的数据预测未来的发展趋势, 更缺乏挖掘数据背后隐藏知识的手段。正是在这样的条件下, 数据挖掘技术应运而生。

4.数据挖掘的研究及其应用现状:

文献:《数据挖掘研究现状及发展趋势》 《数据挖掘研究现状综述》 《数据挖掘综述》

每年有KDD、PAKDD和ECML&PKDD三大学术会议

( 1) KDD( Knowledge Discovery in Databases) 国际学术大会数据挖掘技术出现于20世纪80年代末, 它促成了数据库中的知识发现( KDD) 产生。在1989年美国底特律召开的第十一届国际联合人工智能学术会议上首次提到知识发现这一概念, 到1993年, 美国电气电子工程师学会( IEEE) 的知识与数据工程( Knowledge and Data Engineering) 会刊出版了KDD技术专刊, 发表的论文和摘要体现了当时KDD的最新研究成果和动态。据统计显示, 从1995年至2007年召开的13次KDD国际学术大会中, 9次都在美国主要城市( 如纽约、芝加哥、华盛顿等) 举办, 其余4次均在加拿大举办,从未在北美以外地区举办过。

( 2) PAKDD( Pacific- Asia Conference on KDD) 学术会议

1997年, 也就是首届蒙特利尔KDD国际学术大会召开之后的两年,

PAKDD学术会议在亚太地区顺利召开, 这标志着亚太地区数据挖掘研究进入发展时期。PAKDD会议每年召开一次, 从1997年至2007年的11年中, 亚洲和大洋洲的主要国家都成功举办过该项会议。

(3)ECML/PKDD学术会议( European Conference on Machine Learning

&European Conference on Principles and Practice of Knowledge Discovery in

Databases)是主要由欧洲大陆范围内的一项关于机器学习、数据库中知识发现的原理与实践欧洲会议的国际会议。

数据挖掘主要应用领域

①市场分析和预测:大型超市销售分析与预测、销售渠道与价格分析等;

②金融、银行; 如自动投资系统、可预测最佳投资时机;

③工业生产: 主要用于发现最佳生产过程;

④科学研究:天文定理的发现、用于分析地壳的构造活动等;

⑤Web数据挖掘; 站点访问模式分析、网页内容自动分类;

表1.数据挖掘应用比重 表2.数据挖掘不同领域增长率

数据挖掘的算法平台发展

第一代数据挖掘软件, 支持一个或少数几个数据挖掘算法, 这些算法设计用于数据向量挖掘, 多用于商业系统。Salford Systems公司早期的CART系统就属于这种系统。新加坡国立大学研制的CBA, 其基于关联规则的分类算法, 能从关系数据或者交易数据中挖掘关联规则, 利用关联规则进行分类和预测。

第二代数据挖掘软件系统与数据库管理系统( DBMS) 集成, 支持数据库和数据仓库, 具有高性能的接口, 具有较高的可扩展性。能够挖掘大数据集以及更复杂的数据集和高维数据, 但这一代的数据挖掘软件只注重模型的生成, 典型代表有DB Miner和SAS Enterprise Miner。

第三代数据挖掘系统的特点是和预言模型系统之间能够实现无缝的集成, 使得由数据挖掘软件产生的模型的变化能够及时反映到语言模型系统中, 由数据挖掘软件产生的预言模型能够自动地被操作系统吸收, 从而与操作型系统中的语言模型相联合提供决策支持的功能。它能够挖掘网络环境下

( Internet/Intranet/Extranet) 的分布式和高度异质的数据, 并且能够有效地和操作型系统集成。其缺点是不能支持移动环境。这一代数据挖掘系统关键的技术之一是提供对建立在异

质系统上的多个预言模型以及管理这些预言模型的元数据提供第一级别的支持。SPSS Clementine 就是属于这一代的产品。

第四代软件能够挖掘嵌入式系统、移动系统和普遍存在的计算设备产生的各种类型的数据。

目前国外技术成熟、有较强产业化能力的数据挖掘软件, 其中主要的有:

①SAS Enterprise Miner: SAS系统全称为Statistics Analysis System, 是美国使用最为广泛的三大著名统计分析软件( SAS, SPSS和SYSTAT) 之一, …… 此处隐藏:7029字,全部文档内容请下载后查看。喜欢就下载吧 ……

数据挖掘技术调研.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/fanwen/2176367.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)