教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 教育文库 >

基于词聚类的热点话题检测算法

来源:网络收集 时间:2026-08-14
导读: 2214 20ll,V01.32,No.6 计算机工程与设计ComputerEngineeringandDesign 基于词聚类的热点话题检测算法 龙志神,程葳 (北京城市学院人工智能研究所,北京100083) 摘要:对应用词聚类进行热点话题检

2214

20ll,V01.32,No.6

计算机工程与设计ComputerEngineeringandDesign

基于词聚类的热点话题检测算法

龙志神,程葳

(北京城市学院人工智能研究所,北京100083)

摘要:对应用词聚类进行热点话题检测的算法进行了研究。通过将文档分词并用兼顾长短文章的规则进行特征抽取,将文档聚类空问转化为特征词聚类空间,采用基于互信息的词聚类算法产生热点话题类。以TDT5语料作为测试语料进行了热点话题召回率和话题类纯度评测,实验结果表明,采用基于词聚类的算法进行热,董话题检测,热点话题的平均召回率达到83.8%,话题类的平均类纯度达到94.4%,检测出的热点话题类别易于理解。关键词:互信息;词聚类;热点话题发现;特征词抽取;词汇语义相似度中图法分类号:TP391

文献标识码:A

文章编号:1000.7024(2011)06.2214.04

Kindofhottopicdetectionalgorithmbased

LONGZhi—yi.

on

clusteringkeywords

CHENGWei

(Institute

Abstract:Aflew

ofArtificial

Intelligence,BeijingCityUniversity,Beijing100083,China)

to

algorithmforhottopicdetectionusingwordsclusteringisproposed.Firstdocumentsspaceisconveaedwordsspace

bywordsegmentationandextractionofkeywordsconsideringthelengthofthedocument,thenhottopicclusterisdetectedusingwordsclustering

algorithmbasedmutualinformation.Hottopicrecallandthepureofthetopicismeasured

to

on

theTDT5

corpus.Experiments

showthattheaveragerecallofhottopicdetectionreacheshottopiciseasilyunderstandable.

83.8%,theaveragepureofthetopicclusterreachesto94.4%;thedetected

Keywords:mutualinformation;wordclustering;hottopicdetection;keyphraseextraction;semanticsimilarityofwords

0引言

间相似度用词间互信息进行度量,此方法在应用国际公认评测语料TDT5的实验中,表现了较好性能,其发现热点话题的平均正确率达到94.4%。

网络中的蕈要信息常会被海量数据淹没,因此有效检测网上热点话题,正成为舆情监控、竞争情报等领域的新热点。有关这方面研究大多以话题发现与跟踪…(topic

detectionand

1算法描述

1.1整体框架

如图l所示,本算法包括预处理和词聚类两大部分。其中预处理部分主要负责完成对文档分词、特征向量表示、向量权重计算和特征词抽取等任务。词聚类部分通过对特征向量空间进行基于互信息的聚类,产生以特征词为元素的聚类结果,并经过一定的筛选生成热点话题类。具体描述如下:1.2预处理

因本算法采用的聚类是词聚类,而词聚类是基于特征词进行聚类,故首先需要将文档空间转化为特征词空间;实验发现对文档特征词如不进行必要抽取,不但增加不必要的资源消耗,而且影响算法精度,故算法还需要对文档特征空间进行有效压缩,即进行特征词提取。

本文算法采用具有较高精度的海量分词软件进行分词,然后以当前经典的TFIDF算法计算特征向量权重,并用兼顾

tracking,TDT)技术为基础。TDT技术可以将关于事件分散的信息有效地汇集并组织起来,所关注的是对热点新闻、突发事件进行话题组织。该技术通过大规模文档自动聚类建立话题酬,话题一般用代表该话题的类的所有文档来表示,即用很多篇文档来表示一个话题。这种话题表示不适合人的认知习惯,人们希望话题表示简单明了,因此出现了话题表示Ⅲ、基于话题的多文档摘要”’等研究。不同于上述面向大规模文档的TDT聚类算法,对关键词聚类进行话题检测“l的算法直接对从文档中抽取出的特征词进行聚类,由此产生的类别直接由词构成,即产生的话题直接由特征词表示,避免了话题表示过程。Christi明Wartena等M通过bisectingk-means聚类算法对特征词进行聚类从而达到话题检测的目的,其将特征词在上下文本语料中的统计分布特性作为词间相似度距离的衡量标准。本文提出一种基于互信息的词聚类热点话题发现算法,特征词

收稿日期:2010-06-27;修订日期:2010.08.29。

基金项目:国家863高技术研究发展计划基金项目(2005从147030);国家242信息安全计划基金项目(2005A37)。

作者简介:龙志秭(1979~),女,江西抚州人,硕士,讲师,研究方向为互联网内容安全、自然语言处理;士,副教授,研究方向为互联网内容分析、自然语言处理。E-maihlongzhiyi@bcu.edu.cn

程葳(1973一),女,北京人,博

龙志讳,程葳:基于词聚类的热点话题检测算法

甲基于互信息的词聚类器

l计剪待聚臻特符词埘问If摹j-亘信息的相似度I

量N

图l算法的整体框架

长短文章的规则进行特征抽取,以保证特征词提取的有效性。具体预处理过程为:

(1)应用海量分词软件模块对文档进行分词。

(2)将文档表示为特征词向量空间形式D:{、v何),…,w何),…,

w∽)},其中w(万)表示文档向量D中第i个特征i五qf,的权重,朋

表示文档的特征词个数,计算公式如下所示

啡)。撇)×Iog(赭汐

(1)

式中:£f够卜—彳在文档向量D中出现的频率(以下简称词频);

df,们卜训练集合中包箭的文档数:M卜训练集合的总

文档数;训练集合是指专门用于统计特征词文档频率的大规模语料库,本算法中NN=626,13l。

O)将文档特征按照权重由大到小排序W们’≥…≥w

够,)≥…W蠊,),然后根据式(2)进行特征词抽取。其中^为文档

特征词个数阈值,舅为百分比阈值

。=G兹暑兹若兹;}甜Ⅸ川/矿f鬟^c2,

上式表示对于长(特征词个数大于A.)文档,将前A,个特征词作为有效特征词;反之,对于短(特征词个数小于^)文档,抽取前九个特征作为有效特征词。

(4)将有效特征词添加到“特征.文档”倒排索引空间。该空间以特征词向量为索引,文档编号和相应的特征词频为检索内容。1.3词聚类

1.3.1

…… 此处隐藏:7965字,全部文档内容请下载后查看。喜欢就下载吧 ……

基于词聚类的热点话题检测算法.doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/1811464.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)