MB-SinglePass_基于组合相似度的微博话题检测(2)
中词j的TF_DF权重,根据式(2)计算得出[10]:
_<
◇q2t3b’记ll
九
八r
(2)
l£厶一最,i玎2lg(詈+o.01)
式中,£^f表示词j在帖子i中的词频,q表示词J在帖子i出
现的次数,M表示帖子i的总词数,N表示总的帖子数,以表
示出现词i的帖子数。o.ol是为了避免出现O值而设定的一个常量。
由于微博帖子较为简短,特征本身就比较稀疏,为了尽可
万方数据
能地利用特征信息,本文借助《同义词林》对主题的关键词向
量进行特征扩展,使关键词特征数量扩大2倍以上。本文设定各扩展特征的权重与其来源特征的权重相同。2.2主题模型
在基于向量空间模型的主题模型中,主题是由一簇帖子组成的。所以,主题向量的物理意义可以理解为主题里各帖子向量的叠加向量的平均,如图1所示。具体的主题向量生成过程是:
1.对各个主题簇内的帖子进行分词,去除停用词,去重并
计算TF_口DF权重形成初始主题向量。
2.对经过步骤1之后形成的关键词进行特征扩展,形成
更丰富的特征向量。
3.对主题内扩展后的文本向量进行叠加平均,得到的向量即为主题向量。
图1主题向量示意图
2.3组合相似度策略2.3.1知网语义相似度
《知网》是一个以汉语和英语的词语所代表的概念为描述对象,以揭示概念与概念之间以及概念所具有的属性之间的关系为基本内容的常识知识库[11]。
《知网》中有两个主要的概念:“概念”与“义原”。“概念”
是对词汇语义的一种描述。每一个词可以用一个或多个概念来描述。“概念”在知网里是用“知识表示语言”来描述的。
“义原”是描述“概念”的最小意义单位,也是“知识表示语言”
所用的“词汇”。与其他语义词典不同,《知网》并不是简单地将所有的“概念”归结到一个树状的概念层次体系中,而是试图用一系列的“义原”来对每一个“概念”进行描述。
本文使用的语义相似度方法参考了刘群、李素建的论
文——基于《知网》的词汇语义相似度计算口”,其中,针对知
网收录词,语义相似度计算包括以下几种情况:
1.实词与虚词相似度为o。
2.虚词概念只有{句法义原)或者{关系义原}两种描述方式,因此,两个虚词概念之间的相似度等于对应句法义原或关
系义原之间的相似度,见式(3):
sh(众,A)2南
(3)
式中,d表示义原p,,户。在知网义原层次体系中的路径长度,
口是一个可调节参数。
3.实词概念可以用4种不同义项类型来描述,第一种是第一基本义原描述式,是对实词最重要的一种描述;第二种是
除第一基本义原之外的其他基本义原描述式,是一个义原集合;第三种是关系义原描述;第四种符号义原描述。一般地,
两个实词概念之间的相似度可由式(4)来计算:
4
i
sh(s-,sz)一郛盟si岫(s ,sz)
(4)
199
式中,s嘶(5,,Sz)(歹一l,2,3,4)表示St和S2两个概念对应
上述4种不同义项的两两相似度。届是可调节的参数,且满足:J臼l+屈+届+庳一1;屉>屉>届>厚。这种参数设置方法的意义是使主要义项的相似度对次要义项的相似度进行制约,维持主要义项相似度对整体相似度的主要贡献地位。例
如,如果次要义项相似度高,主要义项相似度低,那么整体相
似度也不会受到次要义项的太大影响。
针对知网未收录词,本文采用以下方法进行处理:1.对于人名
如果两个人名姓氏部分相同,则认为两者具有高相似度,如潘石屹、老潘和潘总;
如果两个人名除姓氏部分相同,则认为其具有较高相似度,如吴菊萍和菊萍;
对于外籍人名,如果存在部分相同匹配,则认为其具有较
高相似度,这主要考虑了外来词音译带来的误差,如本拉登、拉丹和本拉丹。
2.对于地名
针对知网只收录市一级及以上行政区域地名的限制,手工编制各地区简称及下属县、区地名表。对于市级以下行政级别之间的相似度,通过分别将其提升到对应的知网收录的市级以上行政区域进行相似度计算。如郑州金水区与北京朝阳区相似度,可以用知网收录词郑州与北京的相似度来近似。同时,规定属于同一市的各级行政地名之间相似度为1。如金水区与郑州市。
3.对于机构组织
对于机构组织存在简称的情况,如果两个机构名称通过了部分相同匹配,则不加区别,即相似度为1。如“住建部”与“住房与城乡建设部”相似度为l。
4.其他情况
除以上情况之外,如果两个知网未收录词相同,则相似度为l,否则为o。2.3.2组合相似度
常用的相似度计算方法有余弦相似度、雅各比相似度m]、语义相似度吲等。具体地:
余弦相似度的定义为:
sirn。(加毋,加町)一—芋L—]广∑‰×Vh
(5)
(∑垤)(∑瞧)
n—l
H=l
雅各比相似度的定义为:
她c搬,溉,一摆君剁
㈣
式中,1加sn加墨I表示帖子i和帖子J的公共特征数量,
IposiU加sl表示帖子i和帖子J的不同特征数量。借鉴信息融合中的顺序加权思想,语义相似度的定义如下:
设帖子i含有优个关键词,对应的权重为让,,让。,…,
‰,见式(7):
夕oR~[瑚,矗{1/让1,t£舫,d挖/诎2,…,t£耵r矗拥/‰]
(7)
帖子j含有咒个关键词,对应的权重为q。,qz,…,%,见式(8):
户。昌~[uor谚1/功1,伽,磅2/功2,…,tcD,矗_/芑铀]
(8)
则帖子i与帖子J的语义相似度归一化表示见式(9)(由于对
称性,不妨假设m≥竹,反之亦然):
万方数据
200
fsm‰晡(多D嚣,户oS)2
l竺!!堕呈垒!!塑型盟!之箜f2±:::±!垒!鱼坠曼!里!!塑型丝!堂皇墨2
1
墨%
Lsimsenl(御刑≥,声D5f)一max{si芏工lsen2(氆移托乙,豇船,矗露)(9)
式中,Z一1,2,…,竹;r=1,2,…,m;simsen2(伽磁,伽以j)表示词i和词歹的相似度;sbsenl(咖 磁,po彤)表示词i和帖子
歹的相似度。
如引言所述,这3种相似度的思想和角度不同,而且仅单
一使用一种相似度都存在一些不足。本文基于以上认识,提
出了组合相似度策略,见式(10):
sh.。b(po毋,户oS)=si如Ic。。(户。甄,户。町)×a+sinl豇(户。矗,
po唧)×f件sirIl掣撕(户。瞬,户。町)×7
(10)
式中,口,口,y表示加权系数,反映了3种不同相似度对总体相
似度的贡献大小。
2.4主题模型的更新策略
随着帖子依次流人,帖子数量发生变化的对应主题的向量也相应地得到更新。但是,新帖子的加入可能是正确的一
种划分,即相关帖子;也可能是不正确的划分,即伪相关帖子。如果仅仅使用新帖子集合的叠加向量作为来更新主题向量,会存在较大的误差。因此,本文在算法 …… 此处隐藏:2150字,全部文档内容请下载后查看。喜欢就下载吧 ……
相关推荐:
- [专业资料]《蜜蜂之家》教学反思
- [专业资料]过去分词作定语和表语1
- [专业资料]苏州工业园区住房公积金贷款申请表
- [专业资料]保安管理制度及处罚条例细则
- [专业资料]2018年中国工程咨询市场发展现状调研及
- [专业资料]2015年电大本科《学前教育科研方法》期
- [专业资料]数字信号处理实验 matlab版 离散傅里叶
- [专业资料]“十三五”重点项目-虎杖白藜芦醇及功
- [专业资料]2015-2020年中国竹木工艺市场需求及投
- [专业资料]国际贸易理论与实务作业五:理论案例分
- [专业资料]财政部修订发布事业单位会计制度
- [专业资料]BCA蛋白浓度测定试剂盒(增强型)
- [专业资料]工程进度总计划横道图模板(通用版)
- [专业资料]七年级地理同步练习(天气与气候)
- [专业资料]X光安检机介绍火灾自动报警系统的组成
- [专业资料]衢州市人民政府办公室关于印发衢州市区
- [专业资料]经济全球化及其影响[1]
- [专业资料]质粒DNA限制性酶切图谱分析
- [专业资料]国家安全人民防线工作“六项”制度
- [专业资料]劳动力投入计划及保证措施
- 电子账册联网监管培训手册
- 人教版语文七年级上第1课《在山的那边
- 对我区担保行业发展现状的思考与建议
- 平面四边形网格自动生成方法研究
- 2016年党课学习心得体会范文
- 如何设置电脑定时关机
- 全球最美人妖排行榜新鲜出炉
- 社会实践调查报告及问卷
- Visual Basic习题集
- 《鱼我所欲也》课件2
- 浙江省会计从业资格考试试卷
- 全遥控数字音量控制的D 类功率放大器资
- 鞍钢宪法与后福特主义
- 电表的改装与校准实验报告(1)
- 2014年高考理科数学真题解析分类汇编:
- Windows 7 AIK 的使用
- 风电场全场停电事故应急处置方案
- 化工原理选填题题库(下)
- 关于产学研合作教育模式的学习与思考
- 西安先锋公馆项目前期定位报告




