教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 专业资料 >

MB-SinglePass_基于组合相似度的微博话题检测(2)

来源:网络收集 时间:2026-08-31
导读: 中词j的TF_DF权重,根据式(2)计算得出[10]: _< ◇q2t3b’记ll 九 八r (2) l£厶一最,i玎2lg(詈+o.01) 式中,£^f表示词j在帖子i中的词频,q表示词J在帖子i出 现的

中词j的TF_DF权重,根据式(2)计算得出[10]:

_<

◇q2t3b’记ll

八r

(2)

l£厶一最,i玎2lg(詈+o.01)

式中,£^f表示词j在帖子i中的词频,q表示词J在帖子i出

现的次数,M表示帖子i的总词数,N表示总的帖子数,以表

示出现词i的帖子数。o.ol是为了避免出现O值而设定的一个常量。

由于微博帖子较为简短,特征本身就比较稀疏,为了尽可

万方数据

能地利用特征信息,本文借助《同义词林》对主题的关键词向

量进行特征扩展,使关键词特征数量扩大2倍以上。本文设定各扩展特征的权重与其来源特征的权重相同。2.2主题模型

在基于向量空间模型的主题模型中,主题是由一簇帖子组成的。所以,主题向量的物理意义可以理解为主题里各帖子向量的叠加向量的平均,如图1所示。具体的主题向量生成过程是:

1.对各个主题簇内的帖子进行分词,去除停用词,去重并

计算TF_口DF权重形成初始主题向量。

2.对经过步骤1之后形成的关键词进行特征扩展,形成

更丰富的特征向量。

3.对主题内扩展后的文本向量进行叠加平均,得到的向量即为主题向量。

图1主题向量示意图

2.3组合相似度策略2.3.1知网语义相似度

《知网》是一个以汉语和英语的词语所代表的概念为描述对象,以揭示概念与概念之间以及概念所具有的属性之间的关系为基本内容的常识知识库[11]。

《知网》中有两个主要的概念:“概念”与“义原”。“概念”

是对词汇语义的一种描述。每一个词可以用一个或多个概念来描述。“概念”在知网里是用“知识表示语言”来描述的。

“义原”是描述“概念”的最小意义单位,也是“知识表示语言”

所用的“词汇”。与其他语义词典不同,《知网》并不是简单地将所有的“概念”归结到一个树状的概念层次体系中,而是试图用一系列的“义原”来对每一个“概念”进行描述。

本文使用的语义相似度方法参考了刘群、李素建的论

文——基于《知网》的词汇语义相似度计算口”,其中,针对知

网收录词,语义相似度计算包括以下几种情况:

1.实词与虚词相似度为o。

2.虚词概念只有{句法义原)或者{关系义原}两种描述方式,因此,两个虚词概念之间的相似度等于对应句法义原或关

系义原之间的相似度,见式(3):

sh(众,A)2南

(3)

式中,d表示义原p,,户。在知网义原层次体系中的路径长度,

口是一个可调节参数。

3.实词概念可以用4种不同义项类型来描述,第一种是第一基本义原描述式,是对实词最重要的一种描述;第二种是

除第一基本义原之外的其他基本义原描述式,是一个义原集合;第三种是关系义原描述;第四种符号义原描述。一般地,

两个实词概念之间的相似度可由式(4)来计算:

sh(s-,sz)一郛盟si岫(s ,sz)

(4)

199

式中,s嘶(5,,Sz)(歹一l,2,3,4)表示St和S2两个概念对应

上述4种不同义项的两两相似度。届是可调节的参数,且满足:J臼l+屈+届+庳一1;屉>屉>届>厚。这种参数设置方法的意义是使主要义项的相似度对次要义项的相似度进行制约,维持主要义项相似度对整体相似度的主要贡献地位。例

如,如果次要义项相似度高,主要义项相似度低,那么整体相

似度也不会受到次要义项的太大影响。

针对知网未收录词,本文采用以下方法进行处理:1.对于人名

如果两个人名姓氏部分相同,则认为两者具有高相似度,如潘石屹、老潘和潘总;

如果两个人名除姓氏部分相同,则认为其具有较高相似度,如吴菊萍和菊萍;

对于外籍人名,如果存在部分相同匹配,则认为其具有较

高相似度,这主要考虑了外来词音译带来的误差,如本拉登、拉丹和本拉丹。

2.对于地名

针对知网只收录市一级及以上行政区域地名的限制,手工编制各地区简称及下属县、区地名表。对于市级以下行政级别之间的相似度,通过分别将其提升到对应的知网收录的市级以上行政区域进行相似度计算。如郑州金水区与北京朝阳区相似度,可以用知网收录词郑州与北京的相似度来近似。同时,规定属于同一市的各级行政地名之间相似度为1。如金水区与郑州市。

3.对于机构组织

对于机构组织存在简称的情况,如果两个机构名称通过了部分相同匹配,则不加区别,即相似度为1。如“住建部”与“住房与城乡建设部”相似度为l。

4.其他情况

除以上情况之外,如果两个知网未收录词相同,则相似度为l,否则为o。2.3.2组合相似度

常用的相似度计算方法有余弦相似度、雅各比相似度m]、语义相似度吲等。具体地:

余弦相似度的定义为:

sirn。(加毋,加町)一—芋L—]广∑‰×Vh

(5)

(∑垤)(∑瞧)

n—l

H=l

雅各比相似度的定义为:

她c搬,溉,一摆君剁

式中,1加sn加墨I表示帖子i和帖子J的公共特征数量,

IposiU加sl表示帖子i和帖子J的不同特征数量。借鉴信息融合中的顺序加权思想,语义相似度的定义如下:

设帖子i含有优个关键词,对应的权重为让,,让。,…,

‰,见式(7):

夕oR~[瑚,矗{1/让1,t£舫,d挖/诎2,…,t£耵r矗拥/‰]

(7)

帖子j含有咒个关键词,对应的权重为q。,qz,…,%,见式(8):

户。昌~[uor谚1/功1,伽,磅2/功2,…,tcD,矗_/芑铀]

(8)

则帖子i与帖子J的语义相似度归一化表示见式(9)(由于对

称性,不妨假设m≥竹,反之亦然):

万方数据

200

fsm‰晡(多D嚣,户oS)2

l竺!!堕呈垒!!塑型盟!之箜f2±:::±!垒!鱼坠曼!里!!塑型丝!堂皇墨2

墨%

Lsimsenl(御刑≥,声D5f)一max{si芏工lsen2(氆移托乙,豇船,矗露)(9)

式中,Z一1,2,…,竹;r=1,2,…,m;simsen2(伽磁,伽以j)表示词i和词歹的相似度;sbsenl(咖 磁,po彤)表示词i和帖子

歹的相似度。

如引言所述,这3种相似度的思想和角度不同,而且仅单

一使用一种相似度都存在一些不足。本文基于以上认识,提

出了组合相似度策略,见式(10):

sh.。b(po毋,户oS)=si如Ic。。(户。甄,户。町)×a+sinl豇(户。矗,

po唧)×f件sirIl掣撕(户。瞬,户。町)×7

(10)

式中,口,口,y表示加权系数,反映了3种不同相似度对总体相

似度的贡献大小。

2.4主题模型的更新策略

随着帖子依次流人,帖子数量发生变化的对应主题的向量也相应地得到更新。但是,新帖子的加入可能是正确的一

种划分,即相关帖子;也可能是不正确的划分,即伪相关帖子。如果仅仅使用新帖子集合的叠加向量作为来更新主题向量,会存在较大的误差。因此,本文在算法 …… 此处隐藏:2150字,全部文档内容请下载后查看。喜欢就下载吧 ……

MB-SinglePass_基于组合相似度的微博话题检测(2).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/52703.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)