教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 精品文档 > 法律文档 >

垃圾邮件防治策略的研究(3)

来源:网络收集 时间:2026-08-27
导读: SVM)、Boosting方法、粗糙集(Rough Set)等等。这些方法可以分成两类,一是基于规则的方法,这类方法的训练过程就是从训练文本集合中学习分类规则,如决策树、Boosting方法、粗糙集等;另外一类是基于统计的方法,训

SVM)、Boosting方法、粗糙集(Rough Set)等等。这些方法可以分成两类,一是基于规则的方法,这类方法的训练过程就是从训练文本集合中学习分类规则,如决策树、Boosting方法、粗糙集等;另外一类是基于统计的方法,训练过程是一个统计学习过程,得到相应的分类器,如贝叶斯分类算法、k近邻方法等。 4.2.2贝叶斯分类算法

贝叶斯分类器是一类常用的分类器,最基本的形式是简单贝叶斯(Naive Bayes,为朴素贝叶斯)分类器[7]。其原理是计算文本dx属于某个类别cj(j=1,2,?,|c|,|c|为类别个数)的概率P(cj|dx),将文本分到概率最大的类别中去。计算P(cj|dx)时,利用贝叶斯公式如公式1所示: P(cj|dx)?P(cj)P(dx|cj)P(dx) (公式1)

P(cj)是类的先验概率,P(dx|cj)是类条件概率。对同一篇文本,P(dX)不变。设dx表示为特征集合(t1,t2,?,tn),n为特征个数,假设特征之间相互独立,则有:

?P(t|c)P(cj)和P(ti|cj)都可以利用训练集估计。垃圾邮件过滤中,只考虑两个类别:垃圾邮件和合法邮件,

P(dx|cj)?P(t1|cj)*...*P(tn|cj)?iji?1nc=0表示合法邮件,目标是计算P(c=1|d),即邮件属于垃圾邮件的概率值。简单贝叶斯分类器是垃圾邮件内容过滤中广泛应用的文本分类方法,利用这种方法,可以根据训练集自动训练,训练的结果反映了训练集的性质。因此邮件用户可以提供一定数量的垃圾邮件和非垃圾邮件,训练自己的垃圾邮件过滤器,从而反映用户自己的个性需求。 4.2.3决策树

决策树(Decision Tree)是最流行的归纳推理算法之一,被广泛用于解决模式分类的问题。决策树方法的实质是从训练集中学习得到以决策树的形式表示的分类规则。决策树的构造是一个基于实例的归纳学习过程,每一棵决策树包含了从给定的训练数据中归纳出的多条分类规则。按照某种属性的顺序自顶向下地生成一棵树,树的每个节点是属性名,而每条边是属性值,从树根到树叶的一条路径便对应一条规则。分类时,将待分类的文本按照属性值自树根向下逐步比较判断,到叶子结点时,就可以确定文本所属类别。对于垃圾邮件过滤而言,为了构造决策树,先将邮件训练转换为一个信息表T。表中每一行对应一个训练例,

第8页 (共15页)

表中的字段有2类分别为测试属性及决策属性,测试属性、决策属性分别指特征、类别属性。测试属性的值可是相对词频或绝对词频,或是对相对词频或绝对词频进行离散化处理后的值。决策树的算法有很多,如:ID3、C4.5、C5、CART、SLIQ、SPRINT等,这些算法有各自的优势与不足,所以的决策树算法主要围绕两大核心问题展开,即:决策树的生长和决策树的剪枝问题。 4.2.4 Boosting方法

Boosting方法通过对已有的分类器进行加权求和得到最终的分类器。每个分类器称为弱规则或者弱假设,加权求和后的分类器称为强规则。强规则(或强假设)为准确率很高的分类规则(或假设),弱规则(或弱假设)为准确率不高,仅比随}机猜测略好的分类规则(或假设)。最简单的弱假设h(x)可以这样定义,如公式2所示:

h(x)???1,如果x满足某个断?1,x不满足pp(公式2)

弱规则比较好寻找,而强规则较难。一个很自然的想法就是通过一定的训练力一法逐步将一系列弱规则集合提升为强规则,这就是Boosting方法的由来。Boosting方法的基本思想是:给每个训练样本都赋予一个权重,进行T次迭代,每次迭代后,对分类错误的样本加大权重,使得下一次的迭代更加关注这些样本。Boosting方法有多种形式,如AdaBoost, AdaBoost.Ml, AdaBoost.MH等。

Boosting算法具有很多的优点,它有较高的准确率,不需要先验知识,只需要选择合适的迭代次数等。它的缺点是在一定程度上依赖于训练数据集合和弱学习器的选择。如弱学习器太弱或都训练的数据不充足都将导致训练精度的下降。在多种形式的Boosting算法中,AdaBoosting方法是最常用的一种,在垃圾邮件过滤中有很高的性能。 4.2.5支持向量机

支持向量机(Support Vector Machine,简称SVM,也叫做支撑向量机)是在二十世纪90年代以来发展起来的一种统计学习方法,它是统计学习理论中最年轻的内容,也是最实用的部分,其核心内容是在1992到1995年间提出的,目前仍处在不断发展阶段。支持向量机是基于统计学习理论和结构风险最小化原则,通过构造最优分类超平面来指导分类。支持向量机的基本思想可以概括为:首先将输入空间变换到一个新

第9页 (共15页)

空间,然后在这个新空间中求取最优线性分类面。SVM在解决小样本学习、非线性及高维模式识别问题中表现较好。

如图1所示,实心点和空心点分别表示两类的训练样本,在线性可分的情况,可以通过一条直线L可以把两个类别分开,L1和L2分别为平行于分类线L且过各类样本中离分类线最近的点的直线。L1和L2之间的距离叫做两类的分类空隙或分类间隔(margin)。最优分类线定义为:该分类线不但能将两类样本分开,而且要使两类的分类间隔最大。直线L1和L2上的训练样本叫做支持向量(Support Vectors),因为它们支撑了最优分类面。如图1中的分类线L是最优分类线。推广到高维空间,最优分类线就成为最优分类面。对于线性不可分的情形,可以构造一个变换,将问题转换到一个新的空间,在这个新空间中线性可分。

分类线支持向量L1L2 支持向量分类间隔

图1 最优分类面

4.3基于网络流量分析的过滤

基于网络流量分析的过滤,该方法最初并不是用于邮件过滤的, 它借鉴了网络管理中流量分析的原理、方法和技术,通过对垃圾邮件在网络中传播时所产生的网络流量特征进行分析,判别非法邮件。目前,有关该方法的研究还不很成熟。

当前的垃圾邮件过滤技术,它们都是针对垃圾邮件产生过程中的某一环节,提出相应的应对措施。如传统的基于规则的方法,从垃圾邮件产生之初,就通过对垃圾邮件发送者IP地址的识别,将其过滤掉;基于内容的过滤则是关注垃圾邮件的最终环节,通过对垃圾内容的解析,达到辨别是非的目的;基于网络流量分析的过滤,处于垃圾邮件发送的中间环节,通过垃圾邮件在网络传播过程中所具有一些物理特征的分析,对垃圾邮件进行识别和过滤。

对比垃圾邮件和正常邮件,二者最根本的区别在于各自的目的或者

第10页 (共15页)

说是主体不同。正常邮件是人们正常的工作和生活不可缺少的帮手,而非法的邮件则是不法分子传播反动信息、色情和广告的特殊工具。为了达到其非法目的,不法分子在使用电子邮件的过程中就会表现出与正常使用行为不同的特征,并在网络上留下相应的痕迹。

5防范垃圾邮件的几条原则

5.1不要轻易泄露自己的ISP信箱地址

恐怖的是,现在有一种专门收集电子邮件地址的软件,我们只要在网上一暴露自己的电子邮件地址,就会很快被那些专业的E-mail地址收集软件收集起来,然后你就很可能陷入垃圾邮件的轰炸之中。因此,建议一般不要轻易泄露自己的电子邮件地址,尤其是ISP的信箱地址,ISP的电子邮箱是按字节收费的,且容量有限,当信箱中的邮件容量超出后是要多收费的,所以还是小心为妙[4]。 如果不得不留下邮箱地址(如在BBS上求助)以方便其他网友与自己联系,但又不想成为E-mail地址收集软件的猎物,可以采取一些变通的方式。如将myname@huanxiong.com写成myname#huanxiong.com,这样网友会明白你的意思,而E-mail地址收集软件会将其视为非法地址而放你一马。 5.2 …… 此处隐藏:3114字,全部文档内容请下载后查看。喜欢就下载吧 ……

垃圾邮件防治策略的研究(3).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wendang/435582.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)