支持向量机算法的研究及其应用(2)
几乎所有的智能技术均要涉及到知识的运用,而知识的获取是进行知识运用的一个瓶颈。机器学习的目标就是研究如何从各类数据中自动地获取知识。
本文主要就人工智能中的机器学习理论中的支持向量机(Support
Machine。SvM)理论进行讨论与研究。Vector
1.1机器学习的发展历史与现状
对于学习的定义,目前大家比较公认的说法是Simon对学习的阐述:“如果一个系统能够通过执行某种过程而改进它的性能,这就是学习”[陆汝矜,19961。
机器学习的研究主要经历了如下几个阶段[Vapnik,1995;Vapnik,1998;边肇祺等,2000;张学工,2000;王钰等,20011:
1、1943年McCulloeh和Pitts对神经元模型(简写为MP模型)的研究;2、五十年代,在控制理论中,使用多项式等为基函数,利用优化的方法建立模型,以刻画被控对象的行为,这个过程在控制理论中称为辨识或参
算法
三—————————————一
数估计;塑二塞堑丝
3、Rosenblatt的感知机为代表的研究,则是从MP模型出发将扩展为多个
神经元的MP模型作为优化算法的数学基函数;
4、Vapnik提出了“统计学习理论”:
此外,ZdziskewPawlak在1982年提出的粗糙集(roughset)理论也有一定的特色。它是一种新的数学工具,可以用于处理含糊性与不确定性,在数据挖掘中发挥了重要作用[史忠植,19971。
目前,机器学习的研究已不仅是人工智能研究的重要问题,而且已成为计算机科学与技术的核心问题。这种动力来源于数字网络的普及与计算机对社会生活的普遍渗入,由此,根据需求,提出了一些迫切的问题f石纯一,1993;王钰等,2001]:(1)发现海量数据中的规律,特别是那些非结构化的数据。这方面主要的发展是数据中的知识发现;(2)如何对个性化的需求进行处理和分析。1.2有限样本的预测学习方法简介
预测学习方法是机器学习的一个重要研究领域,绝大部分机器学习算法的应用都涉及到对数据的预测性学习,目的是从已知数据中估计相关性以达到准确预测将来数据变化。经典的模式识别方法,各种统计方法以及近些年来出现的各种神经网络算法都被应用于估计这种数据中固有的相关性,试图建立~个能预测未来数据的模型。虽然,这些应用在一些特殊的领域取得了一定的进展,并且提出了一些新的概念和方法,但是,这些方法有其固有的算法缺陷:由于不知道数据的分布密度以及有限的训练数据,常常导致了病态的训练结果,预测效果往往不尽人意。人们迫切需要关于预测学习算法共同的概念和理论框架以及更高效的预测学习方法。
到目前为止,几乎所有的预测学习算法都可以归结为以下三类[Cherkassky,1999]:
(1)传统的统计预测方法
这类方法是在参数结构形式已知的前提下,通过训练数据,预测各参数的值,例如:最d,--乘法。应用这些预测方法除了需要很强的先验知识外,还需预先知道模型的结构形式。但是,在处理大量的实际预测问题时,常常不知道背景知识,面对一大堆采样来的数据,也不知道模型的结构形式。由于传统统计学研究的前提是样本数目趋于无穷大时的渐进理论,而参数预测方法几乎都是建立在这一前提基础之上的。因此只有当采样数据趋于无穷时,参数方法的
算法
浙江大学博士学位论文
训练结果才趋于真实的模型。由于实际样本数目是有限的,很难满足这一前提。
(2)经验非线性预测方法
80年代发展起来的人工神经网络和柔性统计方法就属于这一类。虽然,这些新的方法克服了参数预测方法的部分弱点,能够依照需要,假设数据内在相关性而构造非线性模型。然而,这些非线性方法缺乏统一的数学理论基础,通常是从生物学的理论和一些学术流派中得到灵感,对于诸如神经网络中的结构选择和权重的初值设定,仍需要借助于经验,得到的模型通常是局部最优解,而4}全局最优。
(3)统计学习理论
早期的统计学习理论(StatisticalLearningTheory)是从60年代发展起来的[Vapnik,1963],直到90年代,它一直是作为一种针对有限样本的函数预测问题的纯理论分析工具[Vapnik,1991]。虽然,早期的统计学习理论提出了VC维(Vapnik—Cervonenkis)理论[Vapnik,19711,为衡量预测模型的复杂度,提出了有效的理论框架。但是,它仍然是建立在经验风险最小化原则基础之上,即:以训练的平均误差为最小的模型作为期望的最终模型。所以,早期的统计学习理论一直停留在抽象的理论和概念的探索之中,直到90年代初期,VC维理论还没有得到很好的应用【Cherkassky,1999】。
90年代中期,Vapnik和他的At&TBell实验室小组提出了SVM算法,进一步丰富和发展了统计学习理论,使它不仅是~种理论分析工具,还是一种能构造具有多维预测功能的预测学习算法的工具,使抽象的学习理论能够转化为通用的实际预测算法。
在统计学习理论基础之上发展起来的SVM算法,是一种专门研究有限样本预测的学习方法。与传统统计学相比,SVM算法没有以传统的经验风险最小化原则作为基础,而是建立在结构风险最小化(StructuralmskMinimization,SRM)原理基础之上,发展成为一种新型的结构化学习方法。它能很好的解决有限数量样本的高维模型的构造问题,而且所构造的模型具有很好的预测性能。SVM算法有很多成功的应用都说明了这种基于VC维理论而发展起来的结构化学习方法的潜在优势。
更重要的是:作为SVM算法基础的VC维理论和结构最小化原则也为进一步完善传统的统计预测方法和经验非线性预测方法提供了理论基础和统一的理论框架。如何在此框架下重新构建各类预测方法,解决许多原来难以解决的问题,迸一步发展和完善SVM算法是当前亟待解决的一个问题。国际上已有许多学者为此做了大量的工作。本文基于这一出发点,仔细研究了支持向量机理论、方法及应用。
算法
第一牵绪论
1.3统计学习理论主要内容介绍
缩擒风陵最小|趋缡藤瑾惩统计学习理论掇崮的一释运矮子小样本学习润题的归纳原理,它包括了学习过程的一致性、边界的理论和结构风险最小化原理等部分。它所提出的缩构风险最小化归纳学习过程克服了经验风险墩小化的缺点,实焉中获褥了更好酌学习效巢。下蕊,魏肘此淫论酌一些主要内容逡行介绍。
{.3.{边髯鹣瑾论与∞维
边界理论主要包含了两部分,一是非构造性边界的理论,它可以通过基于谱长溺数的概念获得;二是构造毪的边界,它的主饔润麓是运爝褐造性的概念来估计这些国数。主要需要研究的翊题是后者。
(1)vc维:VC维主要刻画了给定的函数可以打散的类别的数目;
(2)一致收敛静泛纯边界;
根据榉本的分布楚秀独立,可以分别获怒不同性质的学习函数的、可以控制学习机器之推广能力的构造性的边界。
vc缝,简弼言之,它摇述了组成学习梭餮的函数集台的容量,也就是说刻画了此醴数集合的学习能力。vc维越大,函数集合越大,其相殿的学习能力就越强。例如,对于二分类问题而言,h题运 …… 此处隐藏:2172字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [教育文库]夜场KTV服务员的岗位职责及工作流程[1]
- [教育文库]企划、网络、市场绩效考核方案
- [教育文库]学党史、知党情、强党性--“党的基本理
- [教育文库]2016年高考物理大一轮总复习(江苏专版
- [教育文库]干部廉洁自律自查自纠的报告
- [教育文库]2010年北京大学心理学系拟录取硕士研究
- [教育文库]资金时间价值练习题及答案
- [教育文库]保护环境的心得体会
- [教育文库]英语角内容:英语趣味小知识
- [教育文库]档案收集与管理工作通知
- [教育文库]劳动规章制度范本范本
- [教育文库]高考物理一轮复习课后限时作业1运动的
- [教育文库]机械工艺夹具毕业设计195推动架设计说
- [教育文库]通用技术教学比赛说课稿2
- [教育文库]2018年四年级英语下册 Module 7 Unit 2
- [教育文库]第2章 宽带IP网络的体系结构
- [教育文库]九年级化学第五单元课题3《根据化学方
- [教育文库]小学英语六年级情态动词用法归纳
- [教育文库]甲级单位编制窑井盖项目可行性报告(立
- [教育文库]2016-2021年中国城市规划行业全景调研
- 高考英语听力十大场景词汇总结
- 全省领导班子思想政治建设座谈会会议精
- 人教版新课标高一英语提优竞赛试题 下
- 江西省2014年生物中考试题
- 长沙镇食品药品安全事故应急预案
- 《金刚石、石墨和C60》片段教学设计
- 福州教育学院(王旭东)
- 基于EDA音乐播放器的设计
- 9、古诗两首《夜书所见》《九月九日忆
- 小学语文课外阅读有效策略探讨
- 贵州文化产业发展成支柱产业的问卷调查
- 膀胱类癌的诊治体会(附3例报告)
- 发动机积碳产生的原因
- Configuring Code Composer Studio for
- 学生良好的心理素质如何培养点滴谈
- 46 电沉积法制备锂离子电池用硅-锂薄膜
- 美舍雅阁公司管理中各部门职责
- 去壳剥皮的小妙招
- 六自由度运动平台的仿真研究
- Pride and Prejudice(傲慢与偏见)




