基于支持向量机的概率密度估计及其在分布估计算法中的应用(4)
经验风险最小化原则处理的大样本数问题。如果样本数较少,则不能保证经验风险值可以较好的逼近实际风险的值。为了解决经验风险的这个缺点,下面给出结构风险最小化(SRM)归纳原则。这一原则的目的是针对经验风险和置信范围这两项来最小化风险泛函。设函数Q(z,a),a∈人的集合S具有一定的结构,这一结构是由一系列嵌套的函数子集Sk={Q(z,a),a∈人。)组成的,它们满足:
Sc&c…c最…
其中结构的元素满足下面的性质:(2-10)
(1)每个函数集瓯@vc维玩是有限的,因此,曩≤吃≤…≤吃…。
(2)结构的的任何元素S或者包含一个完全有界函数的集合:
0≤Q(z,a)≤坟,a∈人女
或者包含对一定的(p,f。)满足下列不等式的函数集合;
aeAlksup—(I下Qp—(z,—o[)—dF-(z)lip≤f女,.>一(2-1)PSUp——1r—————————一Sf"‘L.>2IQ(z,a)dF(z)
这一结构称为容许结构[11。
对一个给定的观测集zI,…,z,,结构风险最小化原则在保证风险最小的子集瓯中选择使经验最小的函数Q(z,口j)。结构风险最小化原则就是在对给定数据逼近的精度和逼近函数的复杂性之间取得的一种折衷。随着自己序号n的增加,经验风险
概率密度分布相关文献,学习交流所用。
基丁.支持向量机的概率密度估计及其在分布估计算法中的应用
的最小值减小,但决定置信范围的项却增加(图)。结构风险最小化原则通过选择子集S将这两者考虑在内,子集S的选择是使得在这个子集中,最小化经验风险会得到实际风险的最好的界。
图2—2风险的界
Figure2-2theboundofrisk
风险的界是经验风险与置信范围之和。随着结构元素序号的增加,经验风险将减小,而置信范围将增加。最小的风险上界是在结构的某个适当的元素上取得。2.1.5学习过程的一致性
学习过程的的一致性解决的问题是经验风险最小化的学习过程在什么时候能够取得小的实际风险,而什么时候不能取得小的实际风险。
定义‘11:设(五,y1),…,(而,乃)是按照概率分布r(x,y)得到的一系列独立同分布的样本点,fix,a,)是F中使经验风险
1,
‰=号∑L(yi,f(xi口))‘I=l(2—12)
最小化的函数。若对V£>0,有
jimp{R(f(x,a,))一i蜓R(f(x,a))>s}=0,---}oO,E,(2-13)
(2-14){imp{Re.r(f(x,af))一骥R(f(x,a))>£)=0,—÷∞,∈,
即两个序列依概率收敛于同一极限,则结构风险最小化原则对函数集L(y,f(x,口)),
概率密度分布相关文献,学习交流所用。
第一二章统计学习的基本理论
a∈人和概率分布函数F(x,y)是一致的(如图2.1.3所示)。
图2-3期望风险和经验风险的一致性
Figure2—3theconsistencyofexpectedandempiricalrisk
经验风险最小化方法构造了一个函数列L(y,f(x,a,)),,=1,2,…,对这个序列来说若期望风险收敛到最小可能的风险值和经验风险收敛到最小可能的风险值相同,则这个经验风险最小化方法是一致的,这时就可以用经验风险来代替期望风险。定义【l】:函数集Q(z,a),a∈人,定义其子集A(c)如下:
A(c)={口:lQ(z,a)dF(z)>Ga∈人)。
如果对函数集的任意非空子集人(c),c∈-oo,+∞)都有
P
。味)R唧(口)未。骤)尺(a)(2-15)
成立,则经验最小化方法对函数集Q(z,口),口∈人和概率分布是平凡一致的。也就是说经验最小化方法把函数集中取得风险最小值的函数去掉后仍能够满足(2—15)式收敛,则这个经验风险最小化方法是非平凡一致。
2.2核函数特征空间
对于一系列的训练样本点((五,Y1),…,(为,Y,),一可以是向量,扛1,…,,)是线性不可分的,可以使用非线性的方法把这些样本点映射到一个高维特征空间中,使得这些样本点在此特征空间中的映射点是线性可分的。而这种非线性映射方法却有两
概率密度分布相关文献,学习交流所用。
基于支持向量机的概率密度估计及其在分布估计算法中的应用
个缺点:一是特征空间的维数很高,将训练样本分开的超平面不一定能够很好的推广;二是如果要在一个200维的空间中构造一个4或5阶的多项式,需要构造一个上十亿维的特征空间,即产生为维数灾难111。用核函数来构造的非线性映射就可以解决这些问题。
2.2.1特征空间中的学习
目标函数的表达方式决定了学习的目标函数的复杂度,学习任务的难度也随着目标函数的复杂度的增加而增高。根据学习问题的不同,可以选择与之相匹配的表示方法。即可以对训练集进行预处理将其映射到一个新的空间:
x=(xl,…,Xn)—争妒(x)=(≯(x1),…,妒(x。))(2-16)
常用方法是寻找原始数据中包含的必要信息的最小特征集,这就是所谓的维数约简。主成分分析提供了一种将数据映射到特征空间的方法,它将原始数据进行线性组合,并将数据在每个特征方向的方差按大小进行排序。维数约简可能会忽略那些方差很小的方向上的数据。
当使用线性学习器去学习一个非线性关系时,就需要寻找一个非线性特征集,然后将原始数据的表达式转化为非线性关系对应的形式。这个过程也就是应用一个固定的非线性映射将原始数据映射到一个特征空间中,在这个特征空间中使用线性学习器。下面是一个简单学习函数的实例:
.Ⅳ
/(x)=∑w谚(x)+6=<w x>+6#l(2—17)
在(2-17)式中咖:x专F是从原始输入空f日-JN某个特征空间的映射。这个过程中建立的非线性学习器可分为两部分:先通过非线性映射将原始数据映射到一个特征空间F,然后在这个特征空间采用线性学习器对训练样本进行分类。
线性学习器的表达式还具有对偶性质,可以使用训练点与测试点的内积来表示决策函数:
,
厂(x)=∑a,Y脚(一) ≯(x))+6
t=l(2—18)
若在特征空间中可以直接计算出内积<妒(x,)舻(x)>的值,就可以将两步结合起来建立一个非线性的学习器。这种计算方法被称为核函数法。
定义1271:核是一个函数K,对所有x,Z∈X,满足:
概率密度分布相关文献,学习交流所用。
第二章统计学习的基本理论
K(xjz)=(咖(x) 咖(:))
这里咖是从X到(内积)特征空间F的映射。
核函数[271的使用可以将原始空间隐函表达为特征空间,并使得在这个特征空间中可以训练线性学习器,而不需要计算原始数据到特征映射的问题。关于训练样本的唯一信息是它们在特征空『白j的Gram矩阵127],这个矩阵又称为核矩阵。这个方法的关键是找到一个可以高效计算的核函数。
2.2.2核函数的构造
要使用核函数,从定义上来看首先要创建一个与原始数据对应的复杂的特征空间,然后在这个特征空间中计算内积并寻找 …… 此处隐藏:1353字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [小学教育]四年级综合实践活动课《衣物的洗涤》教
- [小学教育]2014半年工作总结怎么写
- [小学教育]20世纪外国文学专题综合试题及答案
- [小学教育]TS_1循环使用催化丙烯环氧化反应研究
- [小学教育]最实用的考勤签到表(上下班签到表)
- [小学教育]气候与生态建筑——以新疆民居为例
- [小学教育]二人以上股东有限责任公司章程参考样本
- [小学教育]2014届第一轮复习资料4.1,3美好生活的
- [小学教育]土方开挖、降水方案
- [小学教育]手绘儿童绘本《秋天的图画》(蜡笔)
- [小学教育]2002级硕士研究生卫生统计学考试试题
- [小学教育]环保装备重点发展目录
- [小学教育]金蝶K3合并报表培训教材
- [小学教育]岩浆岩试题及参考答案
- [小学教育]知之深爱之切学习心得
- [小学教育]第十二章 蛋白质的生物合成
- [小学教育]Chapter 2-3 Solid structure and basi
- [小学教育]市政道路雨季专项施工方案
- [小学教育]中国海洋大学2012-2013学年第二学期天
- [小学教育]教育心理学第3章-学习迁移
- 浅谈深化国企改革中加强党管企业
- 2006年中国病理生理学会学术活动安排
- 设计投标工作大纲
- 基于ARP的网络攻击与防御
- 2016届湖北省七市(州)教科研协作体高三
- Google_学术搜索及其检索技巧
- 2019-2020学年七年级地理下册6.3美洲教
- 城市道路可研报告
- 【名师指津】2012高考英语 写作基础技
- 6级知识点培训北京师范大学《幼儿智趣
- 注册会计师会计知识点:金融资产
- 新安装 500 kV 变压器介损分析与判断
- PS2模拟器PCSX2设置及使用教程.
- 医院药事管理与药剂科管理组织机构
- {PPT背景素材}丹巴的醉人美景,免费,一
- NAS网络存储应用解决方案
- 青海省西宁市六年级上学期数学期末考试
- 测量管理体系手册依据ISO10012:2003
- 洞子小学培养骨干教师工作计划
- 浅谈《牛津初中英语》的教材特点及教学




