教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 小学教育 >

基于支持向量机的概率密度估计及其在分布估计算法中的应用(4)

来源:网络收集 时间:2026-09-02
导读: 经验风险最小化原则处理的大样本数问题。如果样本数较少,则不能保证经验风险值可以较好的逼近实际风险的值。为了解决经验风险的这个缺点,下面给出结构风险最小化(SRM)归纳原则。这一原则的目的是针对经验风

经验风险最小化原则处理的大样本数问题。如果样本数较少,则不能保证经验风险值可以较好的逼近实际风险的值。为了解决经验风险的这个缺点,下面给出结构风险最小化(SRM)归纳原则。这一原则的目的是针对经验风险和置信范围这两项来最小化风险泛函。设函数Q(z,a),a∈人的集合S具有一定的结构,这一结构是由一系列嵌套的函数子集Sk={Q(z,a),a∈人。)组成的,它们满足:

Sc&c…c最…

其中结构的元素满足下面的性质:(2-10)

(1)每个函数集瓯@vc维玩是有限的,因此,曩≤吃≤…≤吃…。

(2)结构的的任何元素S或者包含一个完全有界函数的集合:

0≤Q(z,a)≤坟,a∈人女

或者包含对一定的(p,f。)满足下列不等式的函数集合;

aeAlksup—(I下Qp—(z,—o[)—dF-(z)lip≤f女,.>一(2-1)PSUp——1r—————————一Sf"‘L.>2IQ(z,a)dF(z)

这一结构称为容许结构[11。

对一个给定的观测集zI,…,z,,结构风险最小化原则在保证风险最小的子集瓯中选择使经验最小的函数Q(z,口j)。结构风险最小化原则就是在对给定数据逼近的精度和逼近函数的复杂性之间取得的一种折衷。随着自己序号n的增加,经验风险

概率密度分布相关文献,学习交流所用。

基丁.支持向量机的概率密度估计及其在分布估计算法中的应用

的最小值减小,但决定置信范围的项却增加(图)。结构风险最小化原则通过选择子集S将这两者考虑在内,子集S的选择是使得在这个子集中,最小化经验风险会得到实际风险的最好的界。

图2—2风险的界

Figure2-2theboundofrisk

风险的界是经验风险与置信范围之和。随着结构元素序号的增加,经验风险将减小,而置信范围将增加。最小的风险上界是在结构的某个适当的元素上取得。2.1.5学习过程的一致性

学习过程的的一致性解决的问题是经验风险最小化的学习过程在什么时候能够取得小的实际风险,而什么时候不能取得小的实际风险。

定义‘11:设(五,y1),…,(而,乃)是按照概率分布r(x,y)得到的一系列独立同分布的样本点,fix,a,)是F中使经验风险

1,

‰=号∑L(yi,f(xi口))‘I=l(2—12)

最小化的函数。若对V£>0,有

jimp{R(f(x,a,))一i蜓R(f(x,a))>s}=0,---}oO,E,(2-13)

(2-14){imp{Re.r(f(x,af))一骥R(f(x,a))>£)=0,—÷∞,∈,

即两个序列依概率收敛于同一极限,则结构风险最小化原则对函数集L(y,f(x,口)),

概率密度分布相关文献,学习交流所用。

第一二章统计学习的基本理论

a∈人和概率分布函数F(x,y)是一致的(如图2.1.3所示)。

图2-3期望风险和经验风险的一致性

Figure2—3theconsistencyofexpectedandempiricalrisk

经验风险最小化方法构造了一个函数列L(y,f(x,a,)),,=1,2,…,对这个序列来说若期望风险收敛到最小可能的风险值和经验风险收敛到最小可能的风险值相同,则这个经验风险最小化方法是一致的,这时就可以用经验风险来代替期望风险。定义【l】:函数集Q(z,a),a∈人,定义其子集A(c)如下:

A(c)={口:lQ(z,a)dF(z)>Ga∈人)。

如果对函数集的任意非空子集人(c),c∈-oo,+∞)都有

。味)R唧(口)未。骤)尺(a)(2-15)

成立,则经验最小化方法对函数集Q(z,口),口∈人和概率分布是平凡一致的。也就是说经验最小化方法把函数集中取得风险最小值的函数去掉后仍能够满足(2—15)式收敛,则这个经验风险最小化方法是非平凡一致。

2.2核函数特征空间

对于一系列的训练样本点((五,Y1),…,(为,Y,),一可以是向量,扛1,…,,)是线性不可分的,可以使用非线性的方法把这些样本点映射到一个高维特征空间中,使得这些样本点在此特征空间中的映射点是线性可分的。而这种非线性映射方法却有两

概率密度分布相关文献,学习交流所用。

基于支持向量机的概率密度估计及其在分布估计算法中的应用

个缺点:一是特征空间的维数很高,将训练样本分开的超平面不一定能够很好的推广;二是如果要在一个200维的空间中构造一个4或5阶的多项式,需要构造一个上十亿维的特征空间,即产生为维数灾难111。用核函数来构造的非线性映射就可以解决这些问题。

2.2.1特征空间中的学习

目标函数的表达方式决定了学习的目标函数的复杂度,学习任务的难度也随着目标函数的复杂度的增加而增高。根据学习问题的不同,可以选择与之相匹配的表示方法。即可以对训练集进行预处理将其映射到一个新的空间:

x=(xl,…,Xn)—争妒(x)=(≯(x1),…,妒(x。))(2-16)

常用方法是寻找原始数据中包含的必要信息的最小特征集,这就是所谓的维数约简。主成分分析提供了一种将数据映射到特征空间的方法,它将原始数据进行线性组合,并将数据在每个特征方向的方差按大小进行排序。维数约简可能会忽略那些方差很小的方向上的数据。

当使用线性学习器去学习一个非线性关系时,就需要寻找一个非线性特征集,然后将原始数据的表达式转化为非线性关系对应的形式。这个过程也就是应用一个固定的非线性映射将原始数据映射到一个特征空间中,在这个特征空间中使用线性学习器。下面是一个简单学习函数的实例:

.Ⅳ

/(x)=∑w谚(x)+6=<w x>+6#l(2—17)

在(2-17)式中咖:x专F是从原始输入空f日-JN某个特征空间的映射。这个过程中建立的非线性学习器可分为两部分:先通过非线性映射将原始数据映射到一个特征空间F,然后在这个特征空间采用线性学习器对训练样本进行分类。

线性学习器的表达式还具有对偶性质,可以使用训练点与测试点的内积来表示决策函数:

厂(x)=∑a,Y脚(一) ≯(x))+6

t=l(2—18)

若在特征空间中可以直接计算出内积<妒(x,)舻(x)>的值,就可以将两步结合起来建立一个非线性的学习器。这种计算方法被称为核函数法。

定义1271:核是一个函数K,对所有x,Z∈X,满足:

概率密度分布相关文献,学习交流所用。

第二章统计学习的基本理论

K(xjz)=(咖(x) 咖(:))

这里咖是从X到(内积)特征空间F的映射。

核函数[271的使用可以将原始空间隐函表达为特征空间,并使得在这个特征空间中可以训练线性学习器,而不需要计算原始数据到特征映射的问题。关于训练样本的唯一信息是它们在特征空『白j的Gram矩阵127],这个矩阵又称为核矩阵。这个方法的关键是找到一个可以高效计算的核函数。

2.2.2核函数的构造

要使用核函数,从定义上来看首先要创建一个与原始数据对应的复杂的特征空间,然后在这个特征空间中计算内积并寻找 …… 此处隐藏:1353字,全部文档内容请下载后查看。喜欢就下载吧 ……

基于支持向量机的概率密度估计及其在分布估计算法中的应用(4).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/42933.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)