数据挖掘技术调研
1.定义:
数据挖掘(Data Mining,或称 DM)又称为数据库中的知识发现(Knowledge Discovery from Database,简称 KDD)数据挖掘是一个从不完整的、不明确的、大量的并且包含噪声,具有随机性的实际应用数据中,提取出隐含其中潜在有用的知识或模式的过程。
2.基本概念:
文献:《数据挖掘算法及其应用研究》 《数据挖掘中聚类分析算法的研究与应用》
近十多年来,数据挖掘在全世界信息产业界受到了极大的关注,并飞速发展,究其原因,在于全球信息技术的迅速发展和互联网的快速普及造成了数据过量和信息爆炸,人们迫切需要有这样一种技术可以帮助他们从浩如烟海的信息中找出他们真正需要的、有价值的那一部分信息和知识。而数据挖掘正是解决以上问题的有效手段。关于数据挖掘,最简单明确的表述是从海量、混杂的数据里挖掘或者提取有用模式或知识的一个过程。数据挖掘可以说是一门跨多个学科和知识领域的新兴课题,它将人们应用数据的方式从原本简单的查询提升至在数据里挖掘与发现知识以对决策行为提供支持。而为了能满足人们从数据里发现知识的需求,来自不同领域,如数据库领域、模式识别领域、机器学习领域、人工智能领域、统计学领域、可视化领域和并行计算领域等的诸多优秀的研究者和技术专家都致力于研究这个新兴的课题——数据挖掘,不断研究和创造出优秀的研究成果,也使得数据挖掘成为了新的技术热点。通过数据挖掘可得到多种知识,而这些知识最终可以应用到多个方面,包括给相关组织和个人提供决策支持。在一般情况下用户并不了解大量的数据中蕴藏了哪些有意义有价值的信息,所以,对数
据挖掘系统来说,应该同时能够搜索发现多种形式的信息知识,进而满足用户的实际要求和期望。
。其主要有三个特点:
(1)海量数据。
(2)未知的有价值的规律。数据挖掘所发现的规律,应该是有用的并且不应该是显而易见的,应该是对不同的任务来说有意义的、隐藏的规律。
(3)数据挖掘是一个过程。他需要数据理解、业务理解、数据准备、评估、建模、部署等一系列步骤,数据挖掘人员的业务能力和分析能力对成功有重要的影响。
数据挖掘的主要有任务有两点:描述型和分类预测型的任务。描述型的任务是指通过数据库数据的自身内部联系,从而得到数据库中数据关系或者数据库的概要描述。分类预测型的任务是指通过现有的已经知道的分类的数据学习模型以及类的标签的区别,称作为预测型和分类型。
3.数据挖掘的由来:
上世纪九十年代, 随着数据库系统的广泛应用和网络技术的高速发展, 数据库技术也进入一个全新的阶段, 即从过去仅管理一些简单数据发展到管理由各种计算机所产生的图形、图像、音频、视频、电子档案、Web页面等多种类型的复杂数据, 并且数据量也越来越大。在给我们提供丰富信息的同时, 也体现出明显的海量信息特征。信息爆炸时代, 海量信息给人们带来许多负面影响, 最主要的就是有效信息难以提炼。过多无用的信息必然会产生信息距离( 信息状态转移距离, 是对一个事物信息状态转移所遇到障碍的测度, 简称DIST或DIT )和有用知识的
丢失。这也就是约翰·内斯伯特( John Naisbert) 称为的“ 信息丰富而知识贫乏”窘境。因此, 人们迫切希望能对海量数据进行深入分析, 发现并提取隐藏在其中的信息, 以更好地利用这些数据。但仅以数据库系统的录入、查询、统计等功能, 无法发现数据中存在的关系和规则, 无法根据现有的数据预测未来的发展趋势, 更缺乏挖掘数据背后隐藏知识的手段。正是在这样的条件下, 数据挖掘技术应运而生。
4.数据挖掘的研究及其应用现状:
文献:《数据挖掘研究现状及发展趋势》 《数据挖掘研究现状综述》 《数据挖掘综述》
每年有KDD、PAKDD和ECML&PKDD三大学术会议
( 1) KDD( Knowledge Discovery in Databases) 国际学术大会数据挖掘技术出现于20世纪80年代末, 它促成了数据库中的知识发现( KDD) 产生。在1989年美国底特律召开的第十一届国际联合人工智能学术会议上首次提到知识发现这一概念, 到1993年, 美国电气电子工程师学会( IEEE) 的知识与数据工程( Knowledge and Data Engineering) 会刊出版了KDD技术专刊, 发表的论文和摘要体现了当时KDD的最新研究成果和动态。据统计显示, 从1995年至2007年召开的13次KDD国际学术大会中, 9次都在美国主要城市( 如纽约、芝加哥、华盛顿等) 举办, 其余4次均在加拿大举办,从未在北美以外地区举办过。
( 2) PAKDD( Pacific- Asia Conference on KDD) 学术会议
1997年, 也就是首届蒙特利尔KDD国际学术大会召开之后的两年,
PAKDD学术会议在亚太地区顺利召开, 这标志着亚太地区数据挖掘研究进入发展时期。PAKDD会议每年召开一次, 从1997年至2007年的11年中, 亚洲和大洋洲的主要国家都成功举办过该项会议。
(3)ECML/PKDD学术会议( European Conference on Machine Learning
&European Conference on Principles and Practice of Knowledge Discovery in
Databases)是主要由欧洲大陆范围内的一项关于机器学习、数据库中知识发现的原理与实践欧洲会议的国际会议。
数据挖掘主要应用领域
①市场分析和预测:大型超市销售分析与预测、销售渠道与价格分析等;
②金融、银行; 如自动投资系统、可预测最佳投资时机;
③工业生产: 主要用于发现最佳生产过程;
④科学研究:天文定理的发现、用于分析地壳的构造活动等;
⑤Web数据挖掘; 站点访问模式分析、网页内容自动分类;
表1.数据挖掘应用比重 表2.数据挖掘不同领域增长率
数据挖掘的算法平台发展
第一代数据挖掘软件, 支持一个或少数几个数据挖掘算法, 这些算法设计用于数据向量挖掘, 多用于商业系统。Salford Systems公司早期的CART系统就属于这种系统。新加坡国立大学研制的CBA, 其基于关联规则的分类算法, 能从关系数据或者交易数据中挖掘关联规则, 利用关联规则进行分类和预测。
第二代数据挖掘软件系统与数据库管理系统( DBMS) 集成, 支持数据库和数据仓库, 具有高性能的接口, 具有较高的可扩展性。能够挖掘大数据集以及更复杂的数据集和高维数据, 但这一代的数据挖掘软件只注重模型的生成, 典型代表有DB Miner和SAS Enterprise Miner。
第三代数据挖掘系统的特点是和预言模型系统之间能够实现无缝的集成, 使得由数据挖掘软件产生的模型的变化能够及时反映到语言模型系统中, 由数据挖掘软件产生的预言模型能够自动地被操作系统吸收, 从而与操作型系统中的语言模型相联合提供决策支持的功能。它能够挖掘网络环境下
( Internet/Intranet/Extranet) 的分布式和高度异质的数据, 并且能够有效地和操作型系统集成。其缺点是不能支持移动环境。这一代数据挖掘系统关键的技术之一是提供对建立在异
质系统上的多个预言模型以及管理这些预言模型的元数据提供第一级别的支持。SPSS Clementine 就是属于这一代的产品。
第四代软件能够挖掘嵌入式系统、移动系统和普遍存在的计算设备产生的各种类型的数据。
目前国外技术成熟、有较强产业化能力的数据挖掘软件, 其中主要的有:
①SAS Enterprise Miner: SAS系统全称为Statistics Analysis System, 是美国使用最为广泛的三大著名统计分析软件( SAS, SPSS和SYSTAT) 之一, …… 此处隐藏:7029字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [文秘资料]班长职务辞职报告
- [文秘资料]完美的辞职报告
- [文秘资料]经典的员工辞职报告
- [文秘资料]医院口腔医生辞职报告
- [文秘资料]总经理辞职报告范文四篇
- [文秘资料]超市职员个人辞职报告
- [文秘资料]村妇联主任的辞职报告
- [文秘资料]辞职报告书格式
- [文秘资料]酒店辞职报告简单范文
- [文秘资料]联通的辞职报告
- [文秘资料]2017最新私企员工辞职报告范文
- [文秘资料]2019年度医院基层党组织书记抓党建述职
- [文秘资料]工作时间长辞职报告
- [文秘资料]辞职报告怎么写出来
- [文秘资料]个人能力原因辞职报告
- [文秘资料]网络工程师辞职报告
- [文秘资料]项目部辞职报告
- [文秘资料]缝纫工辞职报告怎么写
- [文秘资料]XXX州委书记述职报告
- [文秘资料]抓基层党建工作述职报告
- (王虎应老师讲课记录)六爻理象思维
- 八个常见投影机故障排除法
- 质量专业综合知识(中级)第一章质量管理
- 煤矿班组建设实施意见
- 我国快餐业与肯德基经营模式的比较与分
- 汽车保险杠模具标准化模架技术工艺研究
- 汽车二级维护作业团体赛比赛规程
- 装卸搬运工安全操作规程
- 高效的工作方法-刘铁
- 依据《生产安全事故报告和调查处理条例
- 2015专业PS夜景亮化效果图制作教程
- 企业劳动定额定员浅析
- 中枢神经系统医学影像学本科五年制第五
- 长城汽车参观探营第三站:研发试验中心
- 小升初语文专项训练
- 建筑工程质量检测资质分类与等级标准
- 周燕珉-我国养老社区的发展现状与规划
- 《生命里最后的读书会》读后感
- 实验室管理评审报告
- CCNA思科网院教程精华之网络基础知识




