基于支持向量机的概率密度估计及其在分布估计算法中的应用(2)
近年来支持向量机的理论已取得了重大进展,它是在统计学习理论的基础上发展起来的新理论,其算法实现策略以及实际应用也发展迅速。它是Vapnic及其合作者在1995年提出来的,这种方法是在训练样本与估计值的差满足一定精度的条件
概率密度分布相关文献,学习交流所用。
基丁支持向量机的概率密度估计及其在分布估计算法中的应用
下,使得经验风险和置信范围的和达到最小,即采用结构风险最小化的方法。与传统的方法比较,支持向量机仅用小样本就可解决求解的问题,它引进的核函数的方法还解决了维数灾难和局部极小值问题,具有很强的处理非线性问题的能力。
在六十年代,V.Vapnik就开始研究统计学习理论的问题¨1,对函数集问题即模式识别问题,提出VC熵和VC维的概念。它们是这一新理论中重要基础,通过这些基础理论概念,发现了泛函空间的大数定律即频率一致收敛于其概率的充分必要条件,研究了它与学习过程的联系,并且得到了关于收敛速率的非渐进界的主要结论¨1;在1971年,VapnikandChervonenkis发表了这些工作的完全证明。所有的这些理论使得建立一个全新的归纳原则即结构风险最小化归纳原则成为可能,从而完成了模式识别学习理论。从1976年到1981年,最初针对指示函数集得到的这些结论推广到了实函数集,主要内容有:大数定律(均值一致收敛于其期望的充分必要条件)、完全有界的函数集和无界函数集一致收敛速度的界,以及结构风险最小化原则。Vapnik和Chervonenkis在1989年发现了经验风险最小化归纳原则和最大似然方法一致性的充分必要条件、完成了对经验风险最小化归纳推理的分析。1995年Vapnik系统地阐述了统计学习理论及支持向量机的概念和分类方法,这标志着统计学习理论体系开始成熟。
1.2分布估计算法发展简史
分布估计算法是进化计算领域中的一类新型的优化算法,不仅成为进化计算领域的研究热点而且也能有效解决地工程应用中的问题。分布估计算法的是在1996年提出f3】,并在以后几年内快速发展成进化计算领域的前沿内容,进化计算领域权威期刊EvolutionaryComputation在2005年出版了分布估计算法的专刊【4J。
分布估计算法采用了一种不同于以往进化算法的新的进化模式。遗传算法首先选择优化问题的一组候选解,这组解可以称为种群。用适应值函数计算种群中每个个体的适应值,然后模拟生物进化的过程按适应值对种群中的个体进行选择,将选择的个体编码之后两两进行交叉,对交叉后产生的新个体进行变异操作,如此反复进行实现问题的求解。与遗传算法的交叉、变异等操作不同,分布估计算法采用统计学习中支持向量机的方法建立解种群的概率分布模型,对这个概率分布进行数学采样产生新的群体,按上述方法反复进行直到终止条件,从而实现群体的进化
【31[5,61。
分布估计算法最早研究的是变量无关的模型,其代表性的算法有PBIL算法、
概率密度分布相关文献,学习交流所用。
第一章绪论
UMDA算法和cGA算法等。Baluja在1994年提出了解决二进制编码的优化问题的PBIL算法[71,该算法是最早的分布估计算法模型。在1996年,德国学者MAuhlenbein提出概率向量的更新算法不同于PBIL算法fl,勺UMDA算法IS]。美国UIUC大学的Harik等人提出了紧致遗传算法【91,它与以上两种算法相比的不同不仅概率模型的更新算法不同,而且eGA需要的种群数量较少,所需要内存容量也很小。分布估计算法关于变量相关性的对研究最早考虑的是双变量相关的算法。这些算法中比较有代表性的有MIMIC算法1101,OMIT算法…1和BMDA算法[12.131等。MIMIC算法是一种启发式优化算法,它的变量是链式相关的。COMIT算法被用来解决双变量相关的优化问题,它采用的概率模型是树状结构。在多变量相关的分布估计算法中变量之间的关系更加复杂,代表性的算法有ECGA算法[141、FDA算法[1Sl和BOAll6-1Sl等。在1998年,德国学者MAuhlenbein提出了可以解决多变量耦合问题的FDA算法。ECGA算法是对eGA算法的扩展。BOA算法是对选择后的优势群体作为样本集构造贝叶斯网络,然后对贝叶斯模型采样产生新一代群体,反复进行。分布估计算法的发展是一个由简单到复杂、有离散到连续的过程。由于连续空间概率模型的复杂性给设计有效的分布估计算法增加了难度,因此连续EDA的发展相对缓慢。UMDAc算法[191和PBILc算法【20】是比较有代表性的变量无关分布估计算法,它们采用了高斯分布作为描述连续解空间的概率模型。UMDAc算法和PBILc算法的不同在于采用了不同的构造方法更新高斯分布模型。除了高斯分布外,直方图分布是日本学者提出的另外一种描述连续解空间概率模型的有效方法。EMNA算法采用多变量的高斯模型表示解的概率分布,在进化过程中采用最大似然估计方法,对高斯分布的均值向量和协方差矩阵进行估计并根据当前群体重新构造高斯图网络结构[211。EMNA算法和EGNA算法采用的都是单峰的概率模型,因此存在一定局限性。IDEA算法1221一定程度上克服了EMNA算法和EGNA算法的缺点,但是IDEA算法也没有充分考虑变量之间的关系。连续域EDA算法的设计还面临很大困难,对于连续变量可以有无限个取值,因此它的搜索空间特别大;通过小样本构造连续空间的概率模型比较困难,因为随
分布估计算法的理论研究相对比较薄弱,它的研究在很多情况下通过试验分析时空复杂度等。Hohfeld等人通过对PBIL算法中概率向量变化过程的分析,得出PBIL出现局部极值。通过对种群规模无穷大的EDA算法进行数学建模,Q.Zhang等证明着维数的增加可能产生维数灾难。来进行。理论研究主要针对概率图模型比较简单的算法,涉及算法的收敛性分析和算法在二进制情况下能保证群体收敛至全局最优解,但对非线性问题该算法可能陷
概率密度分布相关文献,学习交流所用。
基丁.支持向量机的概率密度估计及其在分布估计算法中的应用
了在概率模型能精确反映已选群体的情况下,采用比例选择、截断选择或二个体锦标赛选择的EDA算法能收敛到全局最优。2004年,通过UMDA和FDA两种算法的对比,Q.Zhang得到了影响分布估计算法性能的高阶统计量,理论上证明了FDA算法可加性分解的优化问题能收敛于全局最优解1231。在种群规模无限大的情况下,R.Rastegar等给出了计算EDA算法收敛到全局最优所需要代数的方法。对空间复杂度的研究,YGao等人理论证明了种算法FDA和BOA的空间复杂性是随着问题规模呈指数级增长。在时间复杂度方面,通过研究BOA算法的可扩展性,Pelikan证明在解决可加性分解的黑箱优化问题时,BOA算法适应值函数的计算次数是问题规模的二次多项式或次二次多项式。熵理论成为分布估计算法的理论分析方面的一个重要工具。通过用最大熵逼近理论分析分布估计算法,MJkuhlenbein指出EDA算法通过最小化当前群体概率分布与目标概率分布之间的K.L距离来对实际概率分布作出估计。在2006年,人们给出了熵条件下的分布估 …… 此处隐藏:2789字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [小学教育]四年级综合实践活动课《衣物的洗涤》教
- [小学教育]2014半年工作总结怎么写
- [小学教育]20世纪外国文学专题综合试题及答案
- [小学教育]TS_1循环使用催化丙烯环氧化反应研究
- [小学教育]最实用的考勤签到表(上下班签到表)
- [小学教育]气候与生态建筑——以新疆民居为例
- [小学教育]二人以上股东有限责任公司章程参考样本
- [小学教育]2014届第一轮复习资料4.1,3美好生活的
- [小学教育]土方开挖、降水方案
- [小学教育]手绘儿童绘本《秋天的图画》(蜡笔)
- [小学教育]2002级硕士研究生卫生统计学考试试题
- [小学教育]环保装备重点发展目录
- [小学教育]金蝶K3合并报表培训教材
- [小学教育]岩浆岩试题及参考答案
- [小学教育]知之深爱之切学习心得
- [小学教育]第十二章 蛋白质的生物合成
- [小学教育]Chapter 2-3 Solid structure and basi
- [小学教育]市政道路雨季专项施工方案
- [小学教育]中国海洋大学2012-2013学年第二学期天
- [小学教育]教育心理学第3章-学习迁移
- 浅谈深化国企改革中加强党管企业
- 2006年中国病理生理学会学术活动安排
- 设计投标工作大纲
- 基于ARP的网络攻击与防御
- 2016届湖北省七市(州)教科研协作体高三
- Google_学术搜索及其检索技巧
- 2019-2020学年七年级地理下册6.3美洲教
- 城市道路可研报告
- 【名师指津】2012高考英语 写作基础技
- 6级知识点培训北京师范大学《幼儿智趣
- 注册会计师会计知识点:金融资产
- 新安装 500 kV 变压器介损分析与判断
- PS2模拟器PCSX2设置及使用教程.
- 医院药事管理与药剂科管理组织机构
- {PPT背景素材}丹巴的醉人美景,免费,一
- NAS网络存储应用解决方案
- 青海省西宁市六年级上学期数学期末考试
- 测量管理体系手册依据ISO10012:2003
- 洞子小学培养骨干教师工作计划
- 浅谈《牛津初中英语》的教材特点及教学




