教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 专业资料 >

MB-SinglePass_基于组合相似度的微博话题检测(3)

来源:网络收集 时间:2026-08-31
导读: step6。 Step6判断是否为最后一条帖子,若不是,转入St印3;若是,结束算法。 输入:按发帖时间顺序依次读入帖子posl,pos2,…,pos。输出:各个帖子话题簇C1,C2,… 1.{预处理:

step6。

Step6判断是否为最后一条帖子,若不是,转入St印3;若是,结束算法。

输入:按发帖时间顺序依次读入帖子posl,pos2,…,pos。输出:各个帖子话题簇C1,C2,…

1.{预处理:分词、去停用词、去重、赋权、同义词扩展)

2.count一1;

3.C1+p08】;

4.save

T[1]1;

5.repeat6.count++;7.if(pos。。与已判断帖子t存在转发评论关系)then

8.pos—。归人帖子t所在话题簇a;

9.updateandsave

T[a]c0呲;

10.update

and

save

T[other]∞岫t;

11_end12.else

13.

[maxsim,ClusterNo]一CalMaxsh(pos。。t,T口);//计算最大相似度maxsim及对应簇号ClusterNo

14.if(msimx>vc)then

15.posoo眦c归入austerNo簇16.updateandsave

T[clusterNo]∞呲t;17.update

and

save

T[other]∞∞t;

18.end

19.elseif(maxsim<vn)then

20.create

clusternewand

save

T[new];

21.update

aIld

save

T[other]∞帅t;

22.end23.

else

if(pos—。与austerNo簇内已判断帖子发贴人存在关

注或粉丝关系)then

24.pos。岫t归入C1usterNo簇;

25.updateand

save

T[clusterNo];

26.updateand

save

T[other]咖II;

27.end28.else

29.pos∞t归入CIusterNo簇;

30.T[C1usterNo]㈣一T[clusterNo]。咖t一1;

31.save

T[austerN0]∞岫t;

32.

updateand

save

T[other]。眦;

33.dld34.end35.end36。

end

37.until(count>n)

图2

M艮Sin91ePass算法

万方数据

为了更加清晰直观地表示各步骤之间的关系,图3给出了MB-singlePass算法流程图。

图3

M&SiTlglePass算法流程图

2.6评价方法

本文评价方法采用NIST建立的话题检测与追踪的评价方法,主要的性能指标包括准确率、召回率、漏检率、误检率、

准确率和召回率的综合指标F1侧s“化以及模型指标

NDrm(CD。)。各指标计算公式如下[1]:

准确率P一≠b(14)召回率R5丢乞

(15)漏检率‰2南

(16)误检率PFA一崩与

(17)

No瑚c%,一坠意《鼍曼者争

F1_一…=;黑

(18)

(19)

式中,口为检测到的帖子数,6为检测到的不相关帖子数,c为检测到的相关帖子,d为检测到的不相关帖子。一般地,G幽

取为1,CFA取o.1,P越恻取0.02,只一啊取O.98。

3实验及结果分析

3.1数据采集及预处理

本文以新浪微博为实验平台,采集了清华百年校庆、房地产调控、个税起征点上调、盈江地震、药家鑫事件、杭州最美妈妈、北京地铁事故、本拉登遇袭身亡、日本核辐射、威廉王子大婚等10个热点话题共108981条帖子数据,以及发贴时间、相

应的发贴人及其帖子之间是否存在转发评论等信息。为了更好地测试算法,从每个话题中人工地挑选了100条帖子质量好的数据共计1000条帖子进行测试。转发评论关系主要根

据新浪微博里的转发标志“//@”来进行识别,即标志前的帖

20】

子是对标志后帖子的转发评论。为r获得发贴人之间的关注和粉丝关系,选定实验帖子后,通过正则表达式析取出发贴人m号,进一步获得并建立所有发贴人的关注和粉丝列表,以便在算法过程中匹配发贴人关系。

针对待测试的帖子,采用分词工具对其进行分词、对分词结果去除停用词、去重,并计算每个词的TF-mF权重,最后采用同义词典对帖子特征进行扩展,并赋予权重。中文分词工具采用的是中科院ICTCLAs201l提供的JNI接口,同义词典采用的是哈工大信息检索研究室的同义词词林扩展版。去除停用词是在构建一个停用词典的基础上进行的,该词典还包括微博常用表情符号等,共有487个词。基于此词典,匹配并过滤帖子中存在的停用词。

为了确定组合相似度的加权系数,分别对D+口+),=1且口,风7>0的36种取值可能情况(精度为O.1)测试M侈Sin—

麟舣~舱一枞删,触¨".d7

:i

ooo

_!J1_-I斛黧{l曩腓¨㈣

mi

●宰一”姑珏~

I议且n

.幢¨∞姑一串啡s盯

.,¨㈨h吖㈣撼

图5不同相似度策略下MBsi嘲ePass算法的性能比较

在同一实验参数和检测算法情况下,通过测试比较,可以

看到使用组合相似度策略结果性能指标明显优于余弦相似度

和语义相似度,最多性能可以提高10%。实验充分说明了组

合相似度可以更好地刻画相似度特征。此外,单一使用语义

相似度比单一使用余弦相似度性能更好,性能提高5%以上。

glePass算法的Fl一舢s“僧值。实验表明,当(a,p,y)=

(0.3,O.3,o.4)时,F1一打搬nsH"取得最大值0.8432。因此,本文组合相似度的参数口,口,7取值分别取为o.3、o.3、o.4。在实际应用中,根据实际问题的不同,最佳的加权系数可能是不

同的。

这主要是因为余弦相似度没有考虑到语义信息,而语义信息

在短文本相似度比较中是很重要的因素。

结束语本文针对微博短文本提出了MBSinglePass算法。与基于传统媒体对象的话题检测算法相比,MBSingle—Pass算法考虑了微博平台本身的特点,即微博结构化信息,包括发贴人之间存在的关注关系、帖子的转发评论关系等。同时Ml}SinglePass算法采用了组合相似度和同义词扩展技术,更准确地刻画了相似性和丰富了帖子的特征信息。通过

3.2实验1

为了测试MBsillglePass算法的性能,本文设计了一组对比试验。对照算法也是话题检测常用的增量聚类和增量K_meaIls算法。增量聚类算法只采用单一阈值策略,算法实

际类似于二值分类问题;增量K.mea璐算法按帖子数量设置

窗口长度,值设为50,共两个窗口。实验采用10个话题的平均性能作为相应算法的性能指标。实验结果如图4所示。

与传统话题检测算法增量K_n煳s、增量聚类的比较显示,

M眵SinglePaSs算法在性能上有较大的 …… 此处隐藏:1696字,全部文档内容请下载后查看。喜欢就下载吧 ……

MB-SinglePass_基于组合相似度的微博话题检测(3).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/52703.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)