教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 初中教育 >

基于TFIDF文本特征加权方法的改进研究

来源:网络收集 时间:2026-08-27
导读: 第28卷第2期2011年2月计算机应用与软件 ComputerApplicationsandSoftwareVol.28No.2Feb.2011 基于TFIDF文本特征加权方法的改进研究 张保富施化吉马素琴 (江苏大学计算机科学与通信工程学院 江苏镇江212013) 摘 针对传统TFIDF方法将文档集作为整体来处理

第28卷第2期2011年2月计算机应用与软件

ComputerApplicationsandSoftwareVol.28No.2Feb.2011

基于TFIDF文本特征加权方法的改进研究

张保富施化吉马素琴

(江苏大学计算机科学与通信工程学院

江苏镇江212013)

针对传统TFIDF方法将文档集作为整体来处理,并没有考虑到特征项在类间和类内的分布情况的不足,提出一种结合

信息熵的TFIDF改进方法。该方法采用结合特征项在类间和类内信息分布熵来调整TFIDF特征项的权重计算,避免了那些对分类

能更有效计算文本特征项的权重。实验结果表明该方法提高了文本分类的精确度和召没有贡献的特征项被赋予较大权值的缺陷,回率,是一种比较有效的文本特征加权方法。关键词

TFIDF

文本分类

特征加权

向量空间模型

ANIMPROVEDTEXTFEATUREWEIGHTINGALGORITHMBASEDONTFIDF

ZhangBaofu

ShiHuaji

MaSuqin

(SchoolofComputerScienceandTelecommunicationEngineering,JiangsuUniversity,Zhenjiang212013,Jiangsu,China)

AbstractAimingattheproblemthatthedocumentsetisdealtwithasawholeandthedistributionoffeatureitemsamongandinclasses

isnottakenintofullaccountwhenusingtraditionalTFIDFmethod,animprovedTFIDFmethodwhichiscombinedwithinformationentropyisproposed.ThismethodmodifiesthemethodofcalculatingweightsoffeatureitemsofTFIDFbycombininginformationentropiesoffeatureitemsamongandinclasses,whichovercomesthedefectthatthefeatureitemsthatmadelesscontributiontothecategorisationwouldbegivengreaterweight,thusisabletocalculateweightsoftextfeatureitemsmoreefficiently.Experimentalresultsshowthattheproposedmethodenhancesrecallandprecisionoftextcategorisationandisamoreeffectivetextfeatureweightingmethod.Keywords

Termfrequency-inversedocumentfrequency(TFIDF)

Textcategorisation

Featureweighting

Vectorspacemodel

地计算特征项对每个类的分类贡献,文本分类的精确度和召回

0引言

率也有了很大的提高,是一种比较有效的文本特征权重计算方法。

文本分类是根据文档内容将文档归入一个或者多个预先定义的类别。随着可用电子文档的增长和在线信息的快速膨胀,文本分类技术已经成为处理和组织文本数据的关键技术之一

[1]

1TFIDF方法

TFIDF是目前被广泛采用的权值计算公式,用术语频率乘

。现有的分类方法主要是基于统计理论和机器学习方法

[2]

的,比较著名的文档分类方法有朴素贝叶斯

[4][4](SVM)[3]、K-近邻法、神经网络等。

、支持向量机

TF表示特征项t在文档以逆文档来表示特征项的权值。其中,

d中出现的频率;IDF表示特征项t在文档集合中分布情况的量化。IDF常用的计算方法是

[6]

目前,在很多分类方法中通常都要使用向量空间模型(VSM)

[5]

N

+0.01)n

(1)

,t2,…,tn)及相应权值Wi来表示文本的用特征项(t1,

特征信息。由于分类方法都建立在特征项频率统计和权重计算的基础上,因此特征权重算法的优劣将直接影响到分类的精确度。TFIDF是经典的基于向量空间模型的特征权重计算方法

[6]

IDF=log(

式中N为文档集中的文档数目;n为出现过特征项t的文档数IDF目。TFIDF的主要思想是:如果包含特征项t的文档越少,越大,则说明特征项t具有很好的类别区分能力。另一方面,特那么特征项t的权重也就征项t在文档d中出现的频率越高,越大。

TFIDF的归一化计算在很多情况下还需要将向量归一化,公式

[6]

,它以词频TF和逆文档频数IDF的乘积作为文档特征项

的权值。但是该方法刻画的只是特征项在整个训练集的分布重只考虑包含特征项t的文档的绝对数量和某个文档中要程度,

出现该特征项t的词频,并没有考虑这些包含特征项t的文档在每个类中的分布情况,以及特征项t在某一个类的各个文档中的分布情况。为此,文中提出了一种TFIDF改进方法,该方法结合特征项t在类间和类内的信息分布熵来调整特征项t的权重,从而修正了文本特征项的权重,避免了那些对分类没有贡献的特征项被赋予较大权值的不足。实验结果表明该方法能有效

如下:

收稿日期:2009-12-17。国家自然科学基金项目(60841003);国家火炬计划项目(2004EB33006)。张保富,硕士生,主研领域:文本挖掘。

18

tfi(d)×log(

Wi(d)=

N

+0.01)ni

计算机应用与软件

表2

用TFIDF计算表1权重结果

C10.62630.66810.4017

C2001

C300.78020.6255

2011年

式中ni表示包含特征项ti的文档数。TFIDF方法是将文档集作为整体来处理,特别是其中IDF的计算,并没有考虑到特征项在类间和类内的分布情况,明显存在以下两点不足:

(1)如果一个特征项在一个类的文档中频繁出现,而在其他类中出现比较少,则说明该特征项能够很好代表这个类的文本的特征,这样的特征项应该赋予较高的权重,并应选作为该类文本的特征词以区别于其它类文档。如果一个特征项比较均匀地分布在各个类中,这样特征项对分类的贡献不大,即使包含特也应该被赋予较低的权重。但是式征项t的文档数n比较小,

(2)没有考虑到特征项在类间的如此分布。

(2)同样是集中分布于某一类别的不同特征项,类内分布相对均匀的特征项的权重应该比分布不均匀的要高。因为如果某一特征项只在某个类别的一两篇文档中大量出现,而在类内的其它文档中出现得很少,那么不排除这一两篇文档是该类别因此这样的特征项不具备代表性,权重相应较中特例的情况,低。对此,传统的TFIDF算法也不能很好地处理。C2,C3,如表1所示,假设有三个类别C1,每个类别各有5

t2、t3表示三个特征项;dij个文档,只考虑三个特征项。其中t1、2,3;j=1,2,3,4,5)。表示Ci类的第j篇文档(i=1,

表1

文档词语频率表

t1555000000000000

t20000160000000660

t3101010000101001000101010

∑(tf(d))

i

i=1

(2)

特征项

t1t2t3

类别

2

N2

×[log(+0.01)]

ni

t3对C1的从表2可以看出t1对C1的权重为0.6263,而t2、

0.4017。当文档集中包含的特征项t1、t2文权重分别为0.6681、

档数相同时,这些特征项的权重都由TF来确定,这样就会导致出现t2对C1的分类权重比t1的大,这显然是一个不合理的结

则该特征项分类能力应果。特征项t3均匀分布在每一个类中,

该比较弱,但是从表2知t3却被赋予高的权值。因此,在没有

考虑到特征项在类间和类内的分布的比例情况时,仅仅使用式(2)计算方法会导致很大的误差。

2TFIDF方法的改进

定义1

[7]

p2,…,pn),若给定的概率分布为P=(p1,则有

n

即:该分布传递的信息量称为P的熵,

H(P)=-

∑p·logp

i

2

i=1

i

(3)

定义2若一个文档集合D中所有文档被分成相互独 …… 此处隐藏:9275字,全部文档内容请下载后查看。喜欢就下载吧 ……

基于TFIDF文本特征加权方法的改进研究.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/1565211.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)