数据挖掘中基于可辨识矩阵的连续属性离散化方法
数据挖掘
第24卷第4期2007年4月
统计研究
Statistical
Research
V01.弘。№.4
Apt.2007
数据挖掘中基于可辨识矩阵的
连续属性离散化方法
刘云霞
曾五一
内容提要:连续属性的离散化在数据挖掘中有着非常重要的作用。本文基于可辨识矩阵提出一种连续属性离散化的方法,并利用平均互信息量对离散化结果进行修正。该方法通过统计模拟取得了良好的效果。
关键词:数据挖掘;可辨识矩阵;连续属性;离散化中图分类号:C812
文献标识码:A
文章编号:1002—4565(2007)04—0008—03
DiscretizationofContinuousPropertiesBased
on
Discernibility
Matrix
inData
Mining
LiuYunfia&ZengWuyi
Abstract:Thediscretizationof
continuous
on
propertiesis
very
importantindatamining.Thepaper
puls
forward
a
methodof
discretizationofcontinuouspropertiesbaseddiscernibilitymatrixandrevisesthediscreteresultby
average
mutualinformation.
C.oedeffects
are
achievedthroughthismethodbystatisticalsimulation.
Keywords:Datamining;discemibihtymatrix;continuousproperties;discretization
一、分类及问题的提出
寻找离散化处理方法以及相应的划分停止标准是连续属性离散化的主要研究内容。离散化方法主要有以下几种分类:有监督和无监督、全局和局部、动态和静态等…。这些分类中,有监督与无监督离散化的区别在于离散化时是否考虑了信息分类。
有监督离散化算法要求应尽量减少离散化过程中的信息损耗,或者说应该在保持决策表中分类能力不变的条件下,用尽可能少的断点将属性空间划分为尽可能少的子空间。其实质是把露维空间划分成有限个区域,使得每个区域中的对象的决策值相同,即要保持区间内的一致性和区间之间的差异性。另外,在离散化问题中,应该兼顾信息质量和统计质量幢1。目前对有监督离散化方法的研究主要是从遗传算法、统计检验、粗糙集和信息熵等方面进行的。
Chi2算法是最基本的一种基于独立性假设检验的离散化方法。它依据的是“区间内的一致性和区间之间的差异性”准则,要求区间内类属性的频数分
布大约一致,相邻两个区间中类属性的频数分布不大相同。也就是说,如果合并前相邻区间内类属性的概率分布相同,说明这两相邻区间与目标类的分布是完全独立的,那么它们合并后将不会影响目标类的概率分布。Chi2算法的不足表现在:在列联表中,如果每格期望频率小于某些最小值时,Chi2值的独立性假设检验是不可靠的拉1;每次循环只能归并两个区间,并且当样本规模较大时离散化速度较慢‘3|。
本文就此提出一种基于可辨识矩阵的离散化方法,该方法既能够反映“区间内的一致性和区间之间的差异性”的原则又能够较好地克服Chi2算法的不足。
二、离散化算法的基本思路
(一)基于可辨识矩阵的离散化
在粗糙集理论中,可辨识矩阵的定义如下:令决策表系统为S=(U,R,y,,),R=PUD,P={吼
I
f=1,…,肘}为条件属性集,D={d。}为决策属性
集(或称为类属性集),d。表示决策属性m个类中的
万方数据
数据挖掘
第M卷第4期刘云■■五一:数据挖掘中基于可辨识矩阵的连续属性离散化方法
9
第Z个类;U={茗。,茗:,…,石Ⅳ}是论域(或称为样本集),n.(茹,)是样本xj在属性a;上的取值。
cD(i’j)《l
ak
I
ak
E。P,h小J纠“动}’捌铡(1)
其中,i,.『=1,…,肘。
式(1)描述的是当两个样本的决策属性取值相同时,它们所对应的可辨识矩阵元素的取值为0;当两个样本的决策属性不同且可以通过某些条件属性的取值不同加以区分时,它们所对应的可辨识矩阵元素的取值为这两个样本属性值不同的条件属性集合,即可以区分这两个样本的条件属性集合;当两个样本发生冲突时,即所有的条件属性取值相同而决策属性的取值不同时,则它们所对应的可辨识矩阵中的元素取值为空集。因此,可辨识矩阵元素中是否包含空集元素可以作为判定决策表系统中是否包含不一致信息的依据HJ。
对上述可辨识矩阵产生的规则进行修改,不是辨识两个样本的决策值是否相同,而是在初始区间与类属性形成的列联表中,辨识相邻初始区间之间类属性的分布结构是否相同,即由如下的规则产生可辨识矩阵:
%㈠加譬糍黧嚣孺㈤
其中,‘,t为算法中构造的初始区间。式(2)可以这样理解:只要两个区间都包含有相同的类别即在辨识矩阵中相应的位置处以0表示,例如,如果,,,,I两个区间中都包含有3个类别中的第一和第二类则两区间在矩阵中的对应位置处的标号为0;如果一个区间包含第一和第二类,另一个区间只包含第一类,则两区间在矩阵中对应位置的标号为声。笔者认为将包含的类别相同的相邻区间合并,同将类属性概率分布相同的区间合并一样,都能够反映“区间内的一致性和区间之间的差异性”的原则,因此,可以将可辨识矩阵的思想作为算法中初始区间合并的基础。
(二)平均互信息量对离散化结果的修正在信息论中定义离散随机变量x和l,之间的互信息日(X:y)为
日(X:l,)=H(X)一H(XI
Y)(3)
也可以用概率表示为
以n
y)=蚤蚤Ph确)log揣(4)
万
方数据它表示已知y后盖“残留”的不确定度。这样,在了解y以后,X的不确定度的减少量为日(X)一日(X:y),这个差值实际上也是已知y的取值后所提供的有关x的信息。互信息量日(x:y)是统计依存程度的信息量度,表示它们之间存在的统计依赖关系瞪1。
之所以在本文中提到平均互信息量的概念,是因为根据式(2)进行合并后的结果可能存在区间样本数很小的情况。为避免过度拟合,需要对这些样本数小于阀值的区间再次合并,那么就有应该合并到前一个还是后一个区间的问题。根据平均互信息量的定义知道,如果两区间的平均互信息量小就表
明两区间与类属性的依赖程度小,两区间的合并对
类属性分布的影响也就小,因此可以合并。
设,I、,I+。和,I+:是相邻区间,区间‘、t+。与类属性的平均互信息量以及区间‘+。、,I+:与类属性的平均互信息量分别是
见(¨)=善t+l苫P(,,,d1)log揣(5)
乩(副)-,萎,∑I=1
,=¨l
P(,,,d1)log揣( …… 此处隐藏:1911字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [初中教育]婚姻家庭法学教学教案
- [初中教育]浅谈小学语文教学中的创新教育
- [初中教育]中华人民共和国侵权责任法2009
- [初中教育]2016-2022年中国薄膜太阳能电池行业发
- [初中教育]多级轻型井点降水的应用
- [初中教育]外语教学法流派介绍和简评
- [初中教育]实验一、典型环节及其阶跃响应
- [初中教育]内蒙古2012-2013学年度国家奖学金获奖
- [初中教育]移动通信营销渠道管理探讨
- [初中教育]初三化学第一学期第一第二章基础知识点
- [初中教育]一天的食物教学设计
- [初中教育]光导照明系统的基本结构及工作原理
- [初中教育]长春市十一高、东北师范大学附属中学、
- [初中教育]“十三五”规划重点-配重式装卸车项目
- [初中教育]领导方法和领导艺术
- [初中教育]第三章 植物病虫草鼠害诊断与防治基
- [初中教育]2019届九年级语文上册 第二单元 6纪念
- [初中教育]甲级单位编制水豆腐项目可行性报告(立
- [初中教育]Ch8-1补充 09101数据库系统原理及应用-
- [初中教育]2017-2023年中国吊装设备行业市场分析
- 制作毕业纪念册需要哪些材料
- 2015-2016学年高二化学苏教版选修4课件
- 哈佛管理导师-创建商业案例
- 职场交际中的谈吐礼仪知识与职场会议接
- 中国糕点及面包行业发展现状与竞争战略
- 沂河“12·7”洪水茶山拦河坝
- 管道水流量计算公式
- 4-2发电机火灾事故处置方案
- 数字信号处理实验五
- 2009年经济师(中级)金融专业知识全真试
- 历史街区保护规划--04历史文化遗产保护
- 宁夏回族自治区中小学职称评价标准
- 评先评优测评表
- 圆的切线证明及线段长求解在在中考中的
- 【解析版】2015年江苏省南京外国语学校
- 人教版八年级上册科学第一章习题精华
- 责任心与执行力
- SA8000社会责任管理体系标准培训
- IgA肾病的饮食应注意
- 杭州市建设工程文件归档整理方案(试行)




